Wan2.1-T2V-1.3B
sqwqw
Texto a video
Modelo abierto de generación de vídeo a partir de texto con 1.300 millones de parámetros. Utiliza un Diffusion Transformer con Flow Matching, un codificador de texto T5 multilingüe y el VAE causal 3D Wan-VAE. Está optimizado para vídeo a 480p y puede ejecutarse en GPU de consumo con aproximadamente 8,19 GB de VRAM. Admite texto visual en chino e inglés y se distribuye con licencia Apache 2.0.
Como usar
Instalación y carga mediante Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained(
"sqwqw/Wan2.1-T2V-1.3B",
dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Para utilizar la implementación oficial, primero se descarga el repositorio y sus dependencias:
git clone https://github.com/Wan-Video/Wan2.1.git
cd Wan2.1
pip install -r requirements.txt
pip install "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.1-T2V-1.3B --local-dir ./Wan2.1-T2V-1.3B
Generación básica de vídeo a 480p:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Si la GPU se queda sin memoria, se puede descargar parte del modelo a la CPU:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--offload_model True \
--t5_cpu \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Para este modelo se recomienda --sample_guide_scale 6; --sample_shift puede ajustarse entre 8 y 12.
Funcionalidades
- Generación de vídeo a partir de descripciones de texto.
- Modelo compacto de 1.300 millones de parámetros compatible con GPU de consumo.
- Generación recomendada a 480p; admite 720p, aunque con resultados menos estables.
- Genera vídeos de cinco segundos a 480p en unos cuatro minutos con una RTX 4090, sin cuantización.
- VAE causal 3D para conservar la coherencia temporal y reducir el consumo de memoria.
- Codificador T5 multilingüe con atención cruzada dentro de cada bloque Transformer.
- Capacidad para representar texto visual en chino e inglés.
- Ejecución en una GPU, descarga parcial a CPU y procesamiento distribuido mediante FSDP y xDiT USP.
- Extensión opcional de prompts mediante DashScope o modelos Qwen locales.
- Integración con Diffusers, Gradio, ComfyUI, Hugging Face y ModelScope.
Casos de uso
- Crear clips de vídeo a partir de descripciones escritas.
- Prototipar escenas, conceptos visuales y secuencias narrativas.
- Generar material audiovisual para equipos creativos con hardware limitado.
- Investigar arquitecturas de difusión para vídeo y coherencia temporal.
- Crear demostraciones locales de generación de vídeo con Gradio o ComfyUI.
- Generar escenas que incorporen texto visual en chino o inglés.