Wan2.1-T2V-1.3B
dailyfood
Texto a video
Modelo abierto de generación de vídeo a partir de texto con 1.300 millones de parámetros. Está diseñado para producir vídeos de 5 segundos a 480p en GPU de consumo y utiliza una arquitectura Diffusion Transformer con Flow Matching, codificador de texto T5 y el VAE espaciotemporal Wan-VAE. Esta página es un duplicado de Wan-AI/Wan2.1-T2V-1.3B mantenido por dailyfood.
Como usar
Instala el repositorio y sus dependencias:
git clone https://github.com/Wan-Video/Wan2.1.git
cd Wan2.1
# Requiere torch >= 2.4.0
pip install -r requirements.txt
Descarga el modelo:
pip install "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.1-T2V-1.3B --local-dir ./Wan2.1-T2V-1.3B
Genera un vídeo a 480p en una sola GPU:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Si falta memoria de GPU, activa la descarga del modelo y ejecuta T5 en la CPU:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--offload_model True \
--t5_cpu \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Para este modelo se recomienda --sample_guide_scale 6; --sample_shift puede ajustarse entre 8 y 12.
Funcionalidades
- Generación de vídeo a partir de instrucciones de texto.
- Ejecución con aproximadamente 8,19 GB de VRAM; genera un vídeo de 5 segundos a 480p en unos 4 minutos con una RTX 4090 sin cuantización.
- Resolución recomendada de 480p; puede generar a 720p, aunque con resultados menos estables por el entrenamiento limitado a esa resolución.
- Compatibilidad con texto de entrada en chino e inglés mediante un codificador T5 multilingüe.
- Wan-VAE causal 3D para comprimir vídeo, reducir el uso de memoria y conservar la coherencia temporal.
- Inferencia en una sola GPU, descarga desde Hugging Face o ModelScope y ejecución distribuida mediante FSDP y xDiT USP.
- Extensión opcional de prompts con DashScope o modelos Qwen locales.
- Pesos en formato Safetensors y licencia Apache 2.0.
Casos de uso
- Creación de clips cortos a partir de descripciones textuales.
- Prototipado de escenas, conceptos visuales y storyboards animados.
- Producción experimental de contenido audiovisual en equipos con GPU de consumo.
- Investigación académica sobre generación de vídeo con modelos de difusión.
- Desarrollo de interfaces locales de generación de vídeo mediante Gradio o Diffusers.