Zen Voyager

Axepapag
Texto a video

Modelo de generación de vídeo a partir de texto orientado a la exploración interactiva de escenas y al control de cámara. Está desarrollado por Hanzo AI y Zoo Labs Foundation sobre la arquitectura Zen MoDE (Mixture of Distilled Experts).

Como usar

Instalación:

pip install -U diffusers transformers accelerate

Generación de vídeo con Diffusers:

from diffusers import AutoPipelineForText2Video
import torch

model_id = "zenlm/zen-voyager"
pipe = AutoPipelineForText2Video.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16
)
pipe = pipe.to("cuda")

video_frames = pipe(
    "A drone flying over a tropical coastline at golden hour"
).frames[0]

Acceso mediante la API compatible con OpenAI de Hanzo AI:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.hanzo.ai/v1",
    api_key="your-api-key"
)

response = client.images.generate(
    model="zen-voyager",
    prompt="A drone flying over a tropical coastline at golden hour",
    size="1280x720",
)

print(response.data[0].url)

La página también muestra el repositorio Axepapag/zen-voyager, aunque su ejemplo principal de Diffusers carga zenlm/zen-voyager. El modelo no está desplegado actualmente por ningún proveedor de inferencia de Hugging Face.

Funcionalidades

Generación de secuencias de vídeo desde descripciones en lenguaje natural.
Control de cámara para recorrer y explorar escenas generadas.
Arquitectura Zen MoDE basada en una mezcla de expertos destilados.
Pesos Safetensors fragmentados con aproximadamente 33.000 millones de parámetros en BF16.
Integración con Diffusers y licencia Apache 2.0.

Casos de uso

Crear recorridos de cámara por entornos generados.
Producir planos aéreos y escenas cinematográficas desde instrucciones de texto.
Generar prototipos visuales de mundos y localizaciones.
Explorar escenas sintéticas de forma interactiva.
Crear secuencias conceptuales para previsualización audiovisual.