Zen Voyager
Axepapag
Texto a video
Modelo de generación de vídeo a partir de texto orientado a la exploración interactiva de escenas y al control de cámara. Está desarrollado por Hanzo AI y Zoo Labs Foundation sobre la arquitectura Zen MoDE (Mixture of Distilled Experts).
Como usar
Instalación:
pip install -U diffusers transformers accelerate
Generación de vídeo con Diffusers:
from diffusers import AutoPipelineForText2Video
import torch
model_id = "zenlm/zen-voyager"
pipe = AutoPipelineForText2Video.from_pretrained(
model_id,
torch_dtype=torch.bfloat16
)
pipe = pipe.to("cuda")
video_frames = pipe(
"A drone flying over a tropical coastline at golden hour"
).frames[0]
Acceso mediante la API compatible con OpenAI de Hanzo AI:
from openai import OpenAI
client = OpenAI(
base_url="https://api.hanzo.ai/v1",
api_key="your-api-key"
)
response = client.images.generate(
model="zen-voyager",
prompt="A drone flying over a tropical coastline at golden hour",
size="1280x720",
)
print(response.data[0].url)
La página también muestra el repositorio Axepapag/zen-voyager, aunque su ejemplo principal de Diffusers carga zenlm/zen-voyager. El modelo no está desplegado actualmente por ningún proveedor de inferencia de Hugging Face.
Funcionalidades
- Generación de secuencias de vídeo desde descripciones en lenguaje natural.
- Control de cámara para recorrer y explorar escenas generadas.
- Arquitectura Zen MoDE basada en una mezcla de expertos destilados.
- Pesos Safetensors fragmentados con aproximadamente 33.000 millones de parámetros en BF16.
- Integración con Diffusers y licencia Apache 2.0.
Casos de uso
- Crear recorridos de cámara por entornos generados.
- Producir planos aéreos y escenas cinematográficas desde instrucciones de texto.
- Generar prototipos visuales de mundos y localizaciones.
- Explorar escenas sintéticas de forma interactiva.
- Crear secuencias conceptuales para previsualización audiovisual.