Wan2.1-T2V-14B-NABLA-0.7

ai-forever
Texto a video

Modelo de generación de vídeo a partir de texto con 14.000 millones de parámetros, ajustado sobre Wan 2.1. Incorpora NABLA con umbral 0,7, un mecanismo dinámico de atención dispersa por bloques que acelera el entrenamiento y la inferencia de vídeo de alta resolución conservando una calidad comparable a la atención completa.

Como usar

Instalación y carga mediante Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained(
    "ai-forever/Wan2.1-T2V-14B-NABLA-0.7",
    dtype=torch.bfloat16,
    device_map="cuda"
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Generación con la configuración ajustada NABLA 0,7:

python generate.py --task t2v-14B --size 1280*720 --ckpt_dir ./Wan2.1-T2V-14B-NABLA-0.7 --prompt {prompt} --frame_num {frame_num}

Uso de NABLA sin ajuste adicional sobre el modelo base:

python generate.py --task t2v-14B --size 1280*720 --ckpt_dir ./Wan2.1-T2V-14B --prompt {prompt} --frame_num {frame_num} --sparse_algo nabla-{thr}

Las dimensiones deben ser divisibles por 128; por ello, una solicitud de 1280×720 se convierte en 1280×640.

Funcionalidades

Generación de vídeo a partir de texto basada en Wan2.1-T2V-14B.
Atención dispersa adaptativa NABLA con umbral 0,7.
Aceleración de hasta 2,7 veces, dependiendo de la resolución y la configuración.
Calidad similar a la atención completa según CLIP, VBench y evaluación humana.
Compatible con vídeos de 720p o superior, secuencias largas y contenido de alto dinamismo.
Implementación con FlexAttention de PyTorch, sin kernels CUDA personalizados.
Compatible con Sliding Tile Attention (STA) y arquitecturas DiT con atención cruzada.
Licencia Apache 2.0; requiere PyTorch 2.7 o posterior para FlexAttention.

Casos de uso

Crear vídeos de alta resolución a partir de descripciones textuales.
Acelerar la experimentación y la inferencia con Wan 2.1 mediante atención dispersa.
Generar secuencias largas o con mucho movimiento reduciendo el coste de atención.
Investigar mecanismos de atención dispersa adaptativa para transformadores de difusión de vídeo.
Combinar NABLA y STA para estudiar distintos compromisos entre velocidad, dispersión y calidad.