DAMO Text-to-Video MS-1.7B
nachikethmurthy666
Texto a video
Modelo de difusión latente multietapa con 1.000 millones de parámetros, republicado a partir del modelo original de Alibaba DAMO. Genera vídeos de 16 fotogramas desde una descripción textual y funciona con Hugging Face Diffusers.
Como usar
Instala las dependencias y carga el modelo con Diffusers. El ejemplo genera un vídeo desde un prompt y lo exporta a un archivo:
pip install diffusers transformers accelerate torch
from diffusers import DiffusionPipeline
import torch
from diffusers.utils import export_to_video
pipe = DiffusionPipeline.from_pretrained(
"nachikethmurthy666/text-to-video-ms-1.7b",
torch_dtype=torch.float16,
variant="fp16"
).to("cuda")
pipe.enable_model_cpu_offload()
prompt = "An astronaut riding a horse on Mars at sunset"
video = pipe(prompt, num_inference_steps=25).frames[0]
video_path = export_to_video(video)
Funcionalidades
- Generación de texto a vídeo mediante difusión
- Salida de vídeos de 16 fotogramas
- Arquitectura de difusión latente multietapa
- Integración con Hugging Face Diffusers
- Compatible con pesos Safetensors
- Ejecución recomendada en precisión FP16
- Licencia CreativeML OpenRAIL-M
Casos de uso
- Crear clips de vídeo de 16 fotogramas a partir de descripciones textuales
- Experimentar con sistemas generativos de texto a vídeo
- Prototipar experiencias audiovisuales basadas en IA
- Investigar modelos de difusión aplicados a la generación de vídeo
- Generar secuencias visuales para proyectos creativos