SANA-Video 2B 720p
Modelo de difusión de 2.000 millones de parámetros desarrollado por NVIDIA y Sana para generar o modificar vídeos a partir de instrucciones de texto. Produce vídeos de hasta 720p y 81 fotogramas (aproximadamente 5 segundos), utilizando un Transformer de difusión lineal y el VAE LTX2.
Como usar
Está destinado principalmente a investigación. Las instrucciones de inferencia se encuentran en la guía de SANA-Video. También existe una versión compatible con Diffusers. El modelo recibe una descripción textual para generar o modificar un vídeo. No debe utilizarse como fuente factual ni para representar fielmente personas o acontecimientos reales. Puede producir resultados sin fotorealismo perfecto, texto ilegible, dedos incorrectos y pérdida de detalle causada por el autoencoder.
Funcionalidades
- Generación de texto a vídeo con resolución de hasta 720 × 1280 píxeles.
- Generación de 81 fotogramas, equivalentes a unos 5 segundos de vídeo.
- Transformer de difusión con atención lineal para reducir la latencia al procesar grandes secuencias de tokens.
- Caché KV de memoria constante mediante atención lineal por bloques, diseñada para conservar el contexto global sin aumentar progresivamente el consumo de memoria.
- Codificación latente espaciotemporal con LTX2-VAE y compresión de 32 × 32 × 8.
- 2.000 millones de parámetros con precisión BF16 (torch.bfloat16).
- Inferencia compatible con GPU RTX 5090; el autor informa de 29 segundos para generar un vídeo de 5 segundos a 720p.
- Licencia Apache 2.0.
Casos de uso
- Investigación sobre generación eficiente de vídeo mediante modelos de difusión.
- Creación de obras audiovisuales y apoyo a procesos artísticos o de diseño.
- Desarrollo de herramientas educativas y creativas basadas en texto a vídeo.
- Estudio de atención lineal y generación de vídeo con consumo de memoria constante.
- Evaluación de limitaciones, sesgos y métodos de despliegue seguro en modelos generativos.