NimVideo/mochi-1-transformer-42
NimVideo
Texto a video
Transformador destilado de 9.000 millones de parámetros para generación de vídeo a partir de texto, basado en genmoai/mochi-1. Reduce la arquitectura original de 48 a 42 bloques. Los bloques se eliminaron de forma iterativa según el MSE de sus representaciones latentes y, después de cada eliminación, se reentrenaron durante 1.000 pasos los bloques adyacentes.
Como usar
Instala las dependencias:
pip install -U diffusers transformers accelerate
Carga el transformador destilado dentro de la canalización original de Mochi y exporta el resultado como vídeo:
import torch
from diffusers import MochiPipeline, MochiTransformer3DModel
from diffusers.utils import export_to_video
transformer = MochiTransformer3DModel.from_pretrained(
"NimVideo/mochi-1-transformer-42",
torch_dtype=torch.bfloat16,
)
pipe = MochiPipeline.from_pretrained(
"genmo/mochi-1-preview",
transformer=transformer,
variant="bf16",
torch_dtype=torch.bfloat16,
)
pipe.enable_model_cpu_offload()
pipe.enable_vae_tiling()
prompt = "Close-up of a chameleon's eye, with its scaly skin changing color. Ultra high resolution 4k."
frames = pipe(prompt, num_frames=85).frames[0]
export_to_video(frames, "mochi.mp4", fps=30)
Funcionalidades
- Generación de vídeo condicionada por texto
- Arquitectura destilada de 42 bloques frente a los 48 del modelo original
- Compatible con Diffusers mediante MochiTransformer3DModel y MochiPipeline
- Pesos en formato Safetensors con tensores F32
- Compatible con descarga de componentes a CPU y procesamiento del VAE por teselas
- Licencia Apache 2.0
Casos de uso
- Crear clips de vídeo a partir de descripciones textuales
- Producir secuencias visuales estilizadas o cinematográficas
- Experimentar con una variante reducida de Mochi-1
- Integrar generación de vídeo local en flujos basados en Diffusers