NimVideo/mochi-1-transformer-42

NimVideo
Texto a video

Transformador destilado de 9.000 millones de parámetros para generación de vídeo a partir de texto, basado en genmoai/mochi-1. Reduce la arquitectura original de 48 a 42 bloques. Los bloques se eliminaron de forma iterativa según el MSE de sus representaciones latentes y, después de cada eliminación, se reentrenaron durante 1.000 pasos los bloques adyacentes.

Como usar

Instala las dependencias:

pip install -U diffusers transformers accelerate

Carga el transformador destilado dentro de la canalización original de Mochi y exporta el resultado como vídeo:

import torch
from diffusers import MochiPipeline, MochiTransformer3DModel
from diffusers.utils import export_to_video

transformer = MochiTransformer3DModel.from_pretrained(
    "NimVideo/mochi-1-transformer-42",
    torch_dtype=torch.bfloat16,
)

pipe = MochiPipeline.from_pretrained(
    "genmo/mochi-1-preview",
    transformer=transformer,
    variant="bf16",
    torch_dtype=torch.bfloat16,
)

pipe.enable_model_cpu_offload()
pipe.enable_vae_tiling()

prompt = "Close-up of a chameleon's eye, with its scaly skin changing color. Ultra high resolution 4k."
frames = pipe(prompt, num_frames=85).frames[0]
export_to_video(frames, "mochi.mp4", fps=30)

Funcionalidades

Generación de vídeo condicionada por texto
Arquitectura destilada de 42 bloques frente a los 48 del modelo original
Compatible con Diffusers mediante MochiTransformer3DModel y MochiPipeline
Pesos en formato Safetensors con tensores F32
Compatible con descarga de componentes a CPU y procesamiento del VAE por teselas
Licencia Apache 2.0

Casos de uso

Crear clips de vídeo a partir de descripciones textuales
Producir secuencias visuales estilizadas o cinematográficas
Experimentar con una variante reducida de Mochi-1
Integrar generación de vídeo local en flujos basados en Diffusers