Wan2.1_VAE
wanabmeya
Texto a video
VAE causal 3D espacio-temporal de Wan2.1, diseñado para codificar y decodificar vídeos de hasta 1080p de longitud ilimitada conservando la información temporal histórica. Sirve como componente eficiente para generación de vídeo e imagen dentro de la familia Wan2.1.
Como usar
Instalación y uso básico con Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"wanabmeya/Wan2.1_VAE",
dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
El repositorio completo de Wan2.1 también permite descargar los modelos T2V y ejecutar generación de vídeo con generate.py, incluyendo inferencia en una o varias GPU y extensión de prompts mediante Qwen o DashScope.
Funcionalidades
- Compresión espacio-temporal optimizada para reducir el uso de memoria
- Codificación y decodificación de vídeos 1080p de cualquier duración sin pérdida de información temporal
- Arquitectura VAE causal 3D adaptada a generación de vídeo
- Distribuido en formato Safetensors con licencia Apache 2.0
- Integrable con Diffusers y los modelos de generación Wan2.1
Casos de uso
- Componente de codificación y decodificación para generación de vídeo con Wan2.1
- Preprocesamiento y reconstrucción de vídeos 1080p largos manteniendo la coherencia temporal
- Generación de imágenes y vídeos mediante pipelines compatibles con Diffusers
- Integración en flujos de edición de vídeo, image-to-video y text-to-video basados en Wan