Wan2.1-T2V-14B-NABLA-0.7
ai-forever
Texto a video
Modelo de generación de vídeo a partir de texto con 14.000 millones de parámetros, ajustado sobre Wan 2.1. Incorpora NABLA con umbral 0,7, un mecanismo dinámico de atención dispersa por bloques que acelera el entrenamiento y la inferencia de vídeo de alta resolución conservando una calidad comparable a la atención completa.
Como usar
Instalación y carga mediante Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained(
"ai-forever/Wan2.1-T2V-14B-NABLA-0.7",
dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Generación con la configuración ajustada NABLA 0,7:
python generate.py --task t2v-14B --size 1280*720 --ckpt_dir ./Wan2.1-T2V-14B-NABLA-0.7 --prompt {prompt} --frame_num {frame_num}
Uso de NABLA sin ajuste adicional sobre el modelo base:
python generate.py --task t2v-14B --size 1280*720 --ckpt_dir ./Wan2.1-T2V-14B --prompt {prompt} --frame_num {frame_num} --sparse_algo nabla-{thr}
Las dimensiones deben ser divisibles por 128; por ello, una solicitud de 1280×720 se convierte en 1280×640.
Funcionalidades
- Generación de vídeo a partir de texto basada en Wan2.1-T2V-14B.
- Atención dispersa adaptativa NABLA con umbral 0,7.
- Aceleración de hasta 2,7 veces, dependiendo de la resolución y la configuración.
- Calidad similar a la atención completa según CLIP, VBench y evaluación humana.
- Compatible con vídeos de 720p o superior, secuencias largas y contenido de alto dinamismo.
- Implementación con FlexAttention de PyTorch, sin kernels CUDA personalizados.
- Compatible con Sliding Tile Attention (STA) y arquitecturas DiT con atención cruzada.
- Licencia Apache 2.0; requiere PyTorch 2.7 o posterior para FlexAttention.
Casos de uso
- Crear vídeos de alta resolución a partir de descripciones textuales.
- Acelerar la experimentación y la inferencia con Wan 2.1 mediante atención dispersa.
- Generar secuencias largas o con mucho movimiento reduciendo el coste de atención.
- Investigar mecanismos de atención dispersa adaptativa para transformadores de difusión de vídeo.
- Combinar NABLA y STA para estudiar distintos compromisos entre velocidad, dispersión y calidad.