SkyReels-V2-T2V-14B-540P-Diffusers

Skywork
Texto a video

Modelo abierto de generación de video a partir de texto con 14.000 millones de parámetros, perteneciente a la familia SkyReels V2. Genera clips de 540p mediante una canalización de difusión optimizada para seguir instrucciones, mantener la consistencia visual y producir movimiento de calidad cinematográfica.

Como usar

Instala las dependencias y carga el modelo con Diffusers. El siguiente ejemplo genera un video de 97 fotogramas y lo guarda como video.mp4:

pip install -U diffusers transformers accelerate ftfy
import torch
from diffusers import AutoModel, SkyReelsV2Pipeline, UniPCMultistepScheduler
from diffusers.utils import export_to_video

model_id = "Skywork/SkyReels-V2-T2V-14B-540P-Diffusers"

vae = AutoModel.from_pretrained(
    model_id,
    subfolder="vae",
    torch_dtype=torch.float32,
)

pipeline = SkyReelsV2Pipeline.from_pretrained(
    model_id,
    vae=vae,
    torch_dtype=torch.bfloat16,
)

pipeline.scheduler = UniPCMultistepScheduler.from_config(
    pipeline.scheduler.config,
    flow_shift=8.0,
)
pipeline = pipeline.to("cuda")

prompt = (
    "A cat and a dog baking a cake together in a kitchen. "
    "The cat is carefully measuring flour, while the dog is "
    "stirring the batter with a wooden spoon."
)

frames = pipeline(
    prompt=prompt,
    num_inference_steps=50,
    height=544,
    width=960,
    num_frames=97,
).frames[0]

export_to_video(frames, "video.mp4", fps=24, quality=8)

Funcionalidades

Generación de video a partir de descripciones de texto.
Salida recomendada de 544 × 960 píxeles, 97 fotogramas y 24 FPS.
Integración nativa con Diffusers mediante SkyReelsV2Pipeline.
14.000 millones de parámetros y pesos en formato Safetensors.
Ajuste recomendado de 50 pasos de inferencia, guidance scale de 6.0 y flow shift de 8.0.
Descarga de componentes a CPU y TeaCache para reducir memoria o acelerar la inferencia.
Aceleración multi-GPU mediante xDiT USP.
Evaluado con una puntuación total de 83,9 % y una puntuación de calidad de 84,7 % en VBench.
Requiere aproximadamente 43,4 GB de VRAM para generar video a 540p con el modelo de 14B.

Casos de uso

Creación de clips cinematográficos a partir de guiones o descripciones.
Prototipado visual de escenas, anuncios y conceptos audiovisuales.
Generación de animaciones para redes sociales y contenido creativo.
Previsualización de composición, iluminación, personajes y movimiento de cámara.
Producción de secuencias sintéticas para investigación sobre generación de video.