DAMO Text-to-Video MS-1.7B

nachikethmurthy666
Texto a video

Modelo de difusión latente multietapa con 1.000 millones de parámetros, republicado a partir del modelo original de Alibaba DAMO. Genera vídeos de 16 fotogramas desde una descripción textual y funciona con Hugging Face Diffusers.

Como usar

Instala las dependencias y carga el modelo con Diffusers. El ejemplo genera un vídeo desde un prompt y lo exporta a un archivo:

pip install diffusers transformers accelerate torch
from diffusers import DiffusionPipeline
import torch
from diffusers.utils import export_to_video

pipe = DiffusionPipeline.from_pretrained(
    "nachikethmurthy666/text-to-video-ms-1.7b",
    torch_dtype=torch.float16,
    variant="fp16"
).to("cuda")

pipe.enable_model_cpu_offload()

prompt = "An astronaut riding a horse on Mars at sunset"
video = pipe(prompt, num_inference_steps=25).frames[0]
video_path = export_to_video(video)

Funcionalidades

Generación de texto a vídeo mediante difusión
Salida de vídeos de 16 fotogramas
Arquitectura de difusión latente multietapa
Integración con Hugging Face Diffusers
Compatible con pesos Safetensors
Ejecución recomendada en precisión FP16
Licencia CreativeML OpenRAIL-M

Casos de uso

Crear clips de vídeo de 16 fotogramas a partir de descripciones textuales
Experimentar con sistemas generativos de texto a vídeo
Prototipar experiencias audiovisuales basadas en IA
Investigar modelos de difusión aplicados a la generación de vídeo
Generar secuencias visuales para proyectos creativos