Wan2.1-T2V-1.3B

dailyfood
Texto a video

Modelo abierto de generación de vídeo a partir de texto con 1.300 millones de parámetros. Está diseñado para producir vídeos de 5 segundos a 480p en GPU de consumo y utiliza una arquitectura Diffusion Transformer con Flow Matching, codificador de texto T5 y el VAE espaciotemporal Wan-VAE. Esta página es un duplicado de Wan-AI/Wan2.1-T2V-1.3B mantenido por dailyfood.

Como usar

Instala el repositorio y sus dependencias:

git clone https://github.com/Wan-Video/Wan2.1.git
cd Wan2.1
# Requiere torch >= 2.4.0
pip install -r requirements.txt

Descarga el modelo:

pip install "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.1-T2V-1.3B --local-dir ./Wan2.1-T2V-1.3B

Genera un vídeo a 480p en una sola GPU:

python generate.py \
  --task t2v-1.3B \
  --size 832*480 \
  --ckpt_dir ./Wan2.1-T2V-1.3B \
  --sample_shift 8 \
  --sample_guide_scale 6 \
  --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."

Si falta memoria de GPU, activa la descarga del modelo y ejecuta T5 en la CPU:

python generate.py \
  --task t2v-1.3B \
  --size 832*480 \
  --ckpt_dir ./Wan2.1-T2V-1.3B \
  --offload_model True \
  --t5_cpu \
  --sample_shift 8 \
  --sample_guide_scale 6 \
  --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."

Para este modelo se recomienda --sample_guide_scale 6; --sample_shift puede ajustarse entre 8 y 12.

Funcionalidades

Generación de vídeo a partir de instrucciones de texto.
Ejecución con aproximadamente 8,19 GB de VRAM; genera un vídeo de 5 segundos a 480p en unos 4 minutos con una RTX 4090 sin cuantización.
Resolución recomendada de 480p; puede generar a 720p, aunque con resultados menos estables por el entrenamiento limitado a esa resolución.
Compatibilidad con texto de entrada en chino e inglés mediante un codificador T5 multilingüe.
Wan-VAE causal 3D para comprimir vídeo, reducir el uso de memoria y conservar la coherencia temporal.
Inferencia en una sola GPU, descarga desde Hugging Face o ModelScope y ejecución distribuida mediante FSDP y xDiT USP.
Extensión opcional de prompts con DashScope o modelos Qwen locales.
Pesos en formato Safetensors y licencia Apache 2.0.

Casos de uso

Creación de clips cortos a partir de descripciones textuales.
Prototipado de escenas, conceptos visuales y storyboards animados.
Producción experimental de contenido audiovisual en equipos con GPU de consumo.
Investigación académica sobre generación de vídeo con modelos de difusión.
Desarrollo de interfaces locales de generación de vídeo mediante Gradio o Diffusers.