Wan2.1-T2V-1.3B
Ediez
Texto a video
Modelo abierto de generación de vídeo a partir de texto con 1.300 millones de parámetros. Está optimizado para producir vídeos de 480p en GPU de consumo y utiliza una arquitectura Diffusion Transformer con Flow Matching, codificación textual multilingüe mediante T5 y el VAE causal espaciotemporal Wan-VAE. Se distribuye bajo licencia Apache 2.0.
Como usar
Instalación y uso básico con Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"Ediez/Wan2.1-T2V-1.3B",
dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Para usar la implementación oficial, clona el repositorio e instala sus dependencias:
git clone https://github.com/Wan-Video/Wan2.1.git
cd Wan2.1
# Requiere torch >= 2.4.0
pip install -r requirements.txt
huggingface-cli download Wan-AI/Wan2.1-T2V-1.3B --local-dir ./Wan2.1-T2V-1.3B
Generación recomendada a 480p:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Si falta memoria de GPU, añade --offload_model True --t5_cpu. Para este modelo se recomienda --sample_guide_scale 6 y un valor de --sample_shift entre 8 y 12.
Funcionalidades
- Generación de vídeo a partir de descripciones de texto.
- Requiere aproximadamente 8,19 GB de VRAM y puede ejecutarse en GPU de consumo.
- Genera un vídeo de cinco segundos a 480p en unos cuatro minutos con una RTX 4090, según sus autores.
- Admite entradas textuales en inglés y chino, incluida la representación visual de texto en ambos idiomas.
- Wan-VAE preserva la información temporal y permite codificar o decodificar vídeos de 1080p de longitud arbitraria.
- Compatible con Diffusers, ejecución local, Gradio e inferencia distribuida mediante FSDP y xDiT USP.
- Puede generar a 720p, pero sus resultados son menos estables; se recomienda utilizar 480p.
- La ampliación opcional del prompt con DashScope o modelos Qwen añade detalle y puede mejorar la calidad del vídeo.
Casos de uso
- Crear clips de vídeo a partir de guiones, conceptos o descripciones visuales.
- Prototipar escenas, animaciones y piezas audiovisuales en equipos creativos pequeños.
- Experimentar con generación de vídeo en hardware de consumo con memoria limitada.
- Investigar arquitecturas Diffusion Transformer y VAE espaciotemporales.
- Generar vídeos que incorporen texto visual en inglés o chino.
- Ejecutar flujos locales de generación mediante scripts, Diffusers o una interfaz Gradio.