Wan2.1-T2V-1.3B

sqwqw
Texto a video

Modelo abierto de generación de vídeo a partir de texto con 1.300 millones de parámetros. Utiliza un Diffusion Transformer con Flow Matching, un codificador de texto T5 multilingüe y el VAE causal 3D Wan-VAE. Está optimizado para vídeo a 480p y puede ejecutarse en GPU de consumo con aproximadamente 8,19 GB de VRAM. Admite texto visual en chino e inglés y se distribuye con licencia Apache 2.0.

Como usar

Instalación y carga mediante Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained(
    "sqwqw/Wan2.1-T2V-1.3B",
    dtype=torch.bfloat16,
    device_map="cuda"
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Para utilizar la implementación oficial, primero se descarga el repositorio y sus dependencias:

git clone https://github.com/Wan-Video/Wan2.1.git
cd Wan2.1
pip install -r requirements.txt
pip install "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.1-T2V-1.3B --local-dir ./Wan2.1-T2V-1.3B

Generación básica de vídeo a 480p:

python generate.py \
  --task t2v-1.3B \
  --size 832*480 \
  --ckpt_dir ./Wan2.1-T2V-1.3B \
  --sample_shift 8 \
  --sample_guide_scale 6 \
  --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."

Si la GPU se queda sin memoria, se puede descargar parte del modelo a la CPU:

python generate.py \
  --task t2v-1.3B \
  --size 832*480 \
  --ckpt_dir ./Wan2.1-T2V-1.3B \
  --offload_model True \
  --t5_cpu \
  --sample_shift 8 \
  --sample_guide_scale 6 \
  --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."

Para este modelo se recomienda --sample_guide_scale 6; --sample_shift puede ajustarse entre 8 y 12.

Funcionalidades

Generación de vídeo a partir de descripciones de texto.
Modelo compacto de 1.300 millones de parámetros compatible con GPU de consumo.
Generación recomendada a 480p; admite 720p, aunque con resultados menos estables.
Genera vídeos de cinco segundos a 480p en unos cuatro minutos con una RTX 4090, sin cuantización.
VAE causal 3D para conservar la coherencia temporal y reducir el consumo de memoria.
Codificador T5 multilingüe con atención cruzada dentro de cada bloque Transformer.
Capacidad para representar texto visual en chino e inglés.
Ejecución en una GPU, descarga parcial a CPU y procesamiento distribuido mediante FSDP y xDiT USP.
Extensión opcional de prompts mediante DashScope o modelos Qwen locales.
Integración con Diffusers, Gradio, ComfyUI, Hugging Face y ModelScope.

Casos de uso

Crear clips de vídeo a partir de descripciones escritas.
Prototipar escenas, conceptos visuales y secuencias narrativas.
Generar material audiovisual para equipos creativos con hardware limitado.
Investigar arquitecturas de difusión para vídeo y coherencia temporal.
Crear demostraciones locales de generación de vídeo con Gradio o ComfyUI.
Generar escenas que incorporen texto visual en chino o inglés.