Wan2.2-T2V-A14B-Diffusers NF4
Versión cuantizada en NF4 para Diffusers de Wan2.2-T2V-A14B, un modelo de generación de vídeo a partir de texto. Emplea una arquitectura de mezcla de expertos especializada por etapas de eliminación de ruido y permite crear clips de 5 segundos en resoluciones de 480p y 720p. Esta variante reduce los requisitos de memoria mediante cuantización de 4 bits con bitsandbytes.
Como usar
Instala las dependencias:
pip install -U diffusers transformers accelerate bitsandbytes
Carga el modelo cuantizado con Diffusers:
import torch
from diffusers import DiffusionPipeline
pipe = DiffusionPipeline.from_pretrained(
"lopho/Wan2.2-T2V-A14B-Diffusers_nf4",
dtype=torch.bfloat16,
device_map="cuda",
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
result = pipe(prompt)
Las funciones específicas de Wan2.2 pueden requerir la rama principal de Diffusers:
pip install git+https://github.com/huggingface/diffusers
El modelo base A14B puede necesitar una GPU con al menos 80 GB de VRAM sin cuantización. Esta variante NF4 está diseñada para rebajar ese requisito, aunque el consumo real depende de la resolución, el número de fotogramas y las opciones de descarga a CPU.
Funcionalidades
- Generación de vídeo a partir de descripciones textuales
- Arquitectura MoE con expertos diferenciados para las fases de ruido alto y bajo
- Aproximadamente 27.000 millones de parámetros totales y 14.000 millones activos por paso en el modelo base
- Cuantización NF4 de 4 bits para reducir el consumo de memoria
- Compatibilidad con Diffusers y el pipeline WanPipeline
- Generación de clips de 5 segundos a 480p o 720p
- Mayor control de iluminación, composición, contraste y tono de color
- Mejor representación de movimientos complejos gracias a un conjunto de entrenamiento ampliado
- Pesos en formato Safetensors
- Licencia Apache 2.0
Casos de uso
- Crear clips cinematográficos de cinco segundos a partir de prompts
- Producir prototipos visuales y secuencias para storyboards
- Generar animaciones conceptuales con movimientos complejos
- Experimentar con generación de vídeo a 480p y 720p usando menos memoria que el modelo base
- Investigar arquitecturas MoE aplicadas a modelos de difusión de vídeo
- Integrar generación local de vídeo en aplicaciones basadas en Diffusers