SkyReels-V2-T2V-14B-720P-Diffusers

Skywork
Texto a video

Modelo abierto de generación de vídeo a partir de texto, con 14.000 millones de parámetros y salida de hasta 720p. Esta variante de SkyReels-V2 está integrada con Diffusers y se especializa en producir secuencias cinematográficas con buen seguimiento de instrucciones, consistencia visual y movimiento dinámico.

Como usar

Instala las dependencias y carga el modelo con Diffusers. El ejemplo genera un vídeo de 97 fotogramas a 960 × 544; para la configuración nativa de 720p se recomiendan 121 fotogramas a 1280 × 720.

pip install -U diffusers transformers accelerate
# pip install ftfy
import torch
from diffusers import AutoModel, SkyReelsV2Pipeline, UniPCMultistepScheduler
from diffusers.utils import export_to_video

model_id = "Skywork/SkyReels-V2-T2V-14B-720P-Diffusers"

vae = AutoModel.from_pretrained(
    model_id,
    subfolder="vae",
    torch_dtype=torch.float32,
)

pipeline = SkyReelsV2Pipeline.from_pretrained(
    model_id,
    vae=vae,
    torch_dtype=torch.bfloat16,
)

pipeline.scheduler = UniPCMultistepScheduler.from_config(
    pipeline.scheduler.config,
    flow_shift=8.0,
)
pipeline = pipeline.to("cuda")

prompt = (
    "A cat and a dog baking a cake together in a kitchen. "
    "The cat is carefully measuring flour, while the dog is stirring "
    "the batter with a wooden spoon."
)

output = pipeline(
    prompt=prompt,
    num_inference_steps=50,
    height=544,       # 720 para la salida 720p
    width=960,        # 1280 para la salida 720p
    num_frames=97,    # 121 para el modelo 720p
).frames[0]

export_to_video(output, "video.mp4", fps=24, quality=8)

Funcionalidades

Generación de vídeo a partir de descripciones de texto.
Resolución nativa recomendada de 720 × 1280 píxeles y 121 fotogramas.
Arquitectura de 14.000 millones de parámetros distribuida en formato Safetensors.
Integración específica con SkyReelsV2Pipeline de Hugging Face Diffusers.
Ajuste fino supervisado en dos etapas, primero a 540p y después a 720p.
Entrenamiento con aprendizaje por refuerzo para mejorar movimientos complejos y reducir incoherencias físicas.
Generación configurable mediante pasos de inferencia, escala de guía, semilla, velocidad de fotogramas y parámetros del planificador.
Descarga de componentes a CPU y aceleración multi-GPU mediante xDiT USP para gestionar sus elevados requisitos de memoria.
Licencia Skywork.

Casos de uso

Creación de clips cinematográficos a partir de guiones o descripciones narrativas.
Previsualización de escenas para cine, publicidad y producción audiovisual.
Generación de animaciones y contenido visual para redes sociales.
Prototipado de planos, acciones de personajes y movimientos de cámara.
Producción de secuencias sintéticas para proyectos creativos o de investigación sobre vídeo generativo.