AaronHuangWei/Wan2.1-T2V-1.3B-NVFP4RealQuant_weightnoly
Versión cuantizada solo en pesos de Wan2.1-T2V-1.3B para generar vídeos a partir de texto. Emplea una arquitectura Diffusion Transformer con Flow Matching, codificación textual multilingüe mediante T5 y el VAE causal 3D Wan-VAE. Está orientada principalmente a vídeo de 480p y utiliza pesos comprimidos NVFP4/8-bit para reducir los requisitos de almacenamiento y ejecución.
Como usar
Instalación y carga mediante Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" en dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"AaronHuangWei/Wan2.1-T2V-1.3B-NVFP4RealQuant_weightnoly",
dtype=torch.bfloat16,
device_map="cuda",
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
El repositorio original de Wan2.1 también permite generar vídeo desde la línea de comandos:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Para reducir el consumo de memoria en una RTX 4090:
python generate.py \
--task t2v-1.3B \
--size 832*480 \
--ckpt_dir ./Wan2.1-T2V-1.3B \
--offload_model True \
--t5_cpu \
--sample_shift 8 \
--sample_guide_scale 6 \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
Para el modelo de 1.3B se recomienda --sample_guide_scale 6 y un valor de --sample_shift entre 8 y 12. El ejemplo de Diffusers mostrado en la página accede a .images[0], aunque el modelo está etiquetado como texto a vídeo; conviene comprobar la versión de Diffusers y la salida real de esta variante cuantizada.
Funcionalidades
- Generación de vídeo a partir de descripciones de texto.
- Cuantización solo de pesos con NVFP4RealQuant y compressed-tensors.
- Modelo compacto de la familia Wan2.1, concebido para funcionar en GPU de consumo.
- Resolución recomendada de 480p; puede producir 720p, aunque con menor estabilidad.
- Comprensión de indicaciones en inglés y chino, incluida la generación visual de texto en ambos idiomas.
- Wan-VAE causal 3D para conservar la coherencia temporal del vídeo.
- Admite inferencia en una o varias GPU mediante FSDP y xDiT USP.
- Permite ampliar automáticamente las indicaciones mediante DashScope o modelos Qwen locales.
- Licencia Apache 2.0.
Casos de uso
- Creación de clips de vídeo de 480p a partir de descripciones textuales.
- Prototipado de herramientas creativas de texto a vídeo en GPU de consumo.
- Producción de animaciones, escenas cinematográficas y contenido visual generado.
- Investigación sobre generación de vídeo con modelos Diffusion Transformer cuantizados.
- Integración en flujos locales mediante Diffusers, scripts de Wan2.1, Gradio o ComfyUI.
- Generación de escenas que incorporen texto visual en inglés o chino.