Wan2.2-T2V-A14B-Diffusers NF4

lopho
Texto a video

Versión cuantizada en NF4 para Diffusers de Wan2.2-T2V-A14B, un modelo de generación de vídeo a partir de texto. Emplea una arquitectura de mezcla de expertos especializada por etapas de eliminación de ruido y permite crear clips de 5 segundos en resoluciones de 480p y 720p. Esta variante reduce los requisitos de memoria mediante cuantización de 4 bits con bitsandbytes.

Como usar

Instala las dependencias:

pip install -U diffusers transformers accelerate bitsandbytes

Carga el modelo cuantizado con Diffusers:

import torch
from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained(
    "lopho/Wan2.2-T2V-A14B-Diffusers_nf4",
    dtype=torch.bfloat16,
    device_map="cuda",
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
result = pipe(prompt)

Las funciones específicas de Wan2.2 pueden requerir la rama principal de Diffusers:

pip install git+https://github.com/huggingface/diffusers

El modelo base A14B puede necesitar una GPU con al menos 80 GB de VRAM sin cuantización. Esta variante NF4 está diseñada para rebajar ese requisito, aunque el consumo real depende de la resolución, el número de fotogramas y las opciones de descarga a CPU.

Funcionalidades

Generación de vídeo a partir de descripciones textuales
Arquitectura MoE con expertos diferenciados para las fases de ruido alto y bajo
Aproximadamente 27.000 millones de parámetros totales y 14.000 millones activos por paso en el modelo base
Cuantización NF4 de 4 bits para reducir el consumo de memoria
Compatibilidad con Diffusers y el pipeline WanPipeline
Generación de clips de 5 segundos a 480p o 720p
Mayor control de iluminación, composición, contraste y tono de color
Mejor representación de movimientos complejos gracias a un conjunto de entrenamiento ampliado
Pesos en formato Safetensors
Licencia Apache 2.0

Casos de uso

Crear clips cinematográficos de cinco segundos a partir de prompts
Producir prototipos visuales y secuencias para storyboards
Generar animaciones conceptuales con movimientos complejos
Experimentar con generación de vídeo a 480p y 720p usando menos memoria que el modelo base
Investigar arquitecturas MoE aplicadas a modelos de difusión de vídeo
Integrar generación local de vídeo en aplicaciones basadas en Diffusers