FastHunyuan
FastVideo
Texto a video
Modelo acelerado de generación de texto a vídeo, destilado de HunyuanVideo. Produce vídeos de alta calidad en 6 pasos de difusión, con una aceleración aproximada de 8 veces frente a los 50 pasos del modelo original.
Como usar
Clona el repositorio FastVideo y sigue las instrucciones de inferencia incluidas en su README. Como alternativa, utiliza el repositorio oficial de HunyuanVideo con shift configurado en 17, 6 pasos, una resolución de 720x1280x125 y un valor de CFG superior a 6. Una escala CFG alta suele producir vídeos con movimientos más rápidos.
Funcionalidades
- Generación de vídeo a partir de texto
- Inferencia en 6 pasos de difusión
- Resolución de referencia de 720 × 1280 con 125 fotogramas
- Inferencia en una sola GPU RTX 4090
- Cuantización NF4 y LLM-INT8 mediante BitsAndBytes
- La cuantización NF4 requiere aproximadamente 20 GB de VRAM
- Entrenado mediante destilación de consistencia sobre el conjunto de datos MixKit
Casos de uso
- Generación rápida de vídeos a partir de descripciones textuales
- Experimentación con HunyuanVideo usando menos pasos de difusión
- Inferencia local de texto a vídeo en una RTX 4090
- Ajuste fino mediante LoRA con varias GPU