SANA-Video 2B 720p

Efficient-Large-Model
Texto a video

Modelo de difusión de 2.000 millones de parámetros desarrollado por NVIDIA y Sana para generar o modificar vídeos a partir de instrucciones de texto. Produce vídeos de hasta 720p y 81 fotogramas (aproximadamente 5 segundos), utilizando un Transformer de difusión lineal y el VAE LTX2.

Como usar

Está destinado principalmente a investigación. Las instrucciones de inferencia se encuentran en la guía de SANA-Video. También existe una versión compatible con Diffusers. El modelo recibe una descripción textual para generar o modificar un vídeo. No debe utilizarse como fuente factual ni para representar fielmente personas o acontecimientos reales. Puede producir resultados sin fotorealismo perfecto, texto ilegible, dedos incorrectos y pérdida de detalle causada por el autoencoder.

Funcionalidades

Generación de texto a vídeo con resolución de hasta 720 × 1280 píxeles.
Generación de 81 fotogramas, equivalentes a unos 5 segundos de vídeo.
Transformer de difusión con atención lineal para reducir la latencia al procesar grandes secuencias de tokens.
Caché KV de memoria constante mediante atención lineal por bloques, diseñada para conservar el contexto global sin aumentar progresivamente el consumo de memoria.
Codificación latente espaciotemporal con LTX2-VAE y compresión de 32 × 32 × 8.
2.000 millones de parámetros con precisión BF16 (torch.bfloat16).
Inferencia compatible con GPU RTX 5090; el autor informa de 29 segundos para generar un vídeo de 5 segundos a 720p.
Licencia Apache 2.0.

Casos de uso

Investigación sobre generación eficiente de vídeo mediante modelos de difusión.
Creación de obras audiovisuales y apoyo a procesos artísticos o de diseño.
Desarrollo de herramientas educativas y creativas basadas en texto a vídeo.
Estudio de atención lineal y generación de vídeo con consumo de memoria constante.
Evaluación de limitaciones, sesgos y métodos de despliegue seguro en modelos generativos.