FastHunyuan

FastVideo
Texto a video

Modelo acelerado de generación de texto a vídeo, destilado de HunyuanVideo. Produce vídeos de alta calidad en 6 pasos de difusión, con una aceleración aproximada de 8 veces frente a los 50 pasos del modelo original.

Como usar

Clona el repositorio FastVideo y sigue las instrucciones de inferencia incluidas en su README. Como alternativa, utiliza el repositorio oficial de HunyuanVideo con shift configurado en 17, 6 pasos, una resolución de 720x1280x125 y un valor de CFG superior a 6. Una escala CFG alta suele producir vídeos con movimientos más rápidos.

Funcionalidades

Generación de vídeo a partir de texto
Inferencia en 6 pasos de difusión
Resolución de referencia de 720 × 1280 con 125 fotogramas
Inferencia en una sola GPU RTX 4090
Cuantización NF4 y LLM-INT8 mediante BitsAndBytes
La cuantización NF4 requiere aproximadamente 20 GB de VRAM
Entrenado mediante destilación de consistencia sobre el conjunto de datos MixKit

Casos de uso

Generación rápida de vídeos a partir de descripciones textuales
Experimentación con HunyuanVideo usando menos pasos de difusión
Inferencia local de texto a vídeo en una RTX 4090
Ajuste fino mediante LoRA con varias GPU