ByteDance/ContentV-8B

ByteDance
Texto a video

Modelo abierto de 8.000 millones de parámetros para generar vídeo a partir de texto. ContentV reutiliza componentes de Stable Diffusion 3.5 Large y el VAE de Wan2.1, junto con una arquitectura DiT y una estrategia de entrenamiento multietapa basada en flow matching. La variante larga alcanza 85,14 puntos en VBench.

Como usar

Con Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained(
    "ByteDance/ContentV-8B",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Instalación desde el repositorio oficial:

git clone https://github.com/bytedance/ContentV.git
cd ContentV
pip3 install -r requirements.txt

Generación de texto a vídeo con GPU:

python3 demo.py

Se recomienda PyTorch 2.3.1 o posterior y CUDA 12.2 o posterior.

Funcionalidades

Generación de vídeo a partir de texto mediante ContentVPipeline.
8.000 millones de parámetros con pesos BF16 en formato Safetensors.
Arquitectura minimalista que reutiliza modelos preentrenados de generación de imágenes.
Entrenamiento multietapa con flow matching para reducir el coste computacional.
Optimización mediante RLHF sin anotaciones humanas adicionales.
Puntuación VBench de 85,14 para ContentV Long y 84,11 para ContentV Short.
Basado en Stable Diffusion 3.5 Large y el VAE de Wan2.1.

Casos de uso

Crear vídeos a partir de descripciones textuales.
Investigar arquitecturas DiT eficientes para generación de vídeo.
Experimentar con entrenamiento de modelos de vídeo reutilizando modelos de imagen preentrenados.
Evaluar sistemas de generación de vídeo con VBench.
Desarrollar prototipos académicos o comerciales sujetos a las licencias de sus componentes.