ByteDance/ContentV-8B
ByteDance
Texto a video
Modelo abierto de 8.000 millones de parámetros para generar vídeo a partir de texto. ContentV reutiliza componentes de Stable Diffusion 3.5 Large y el VAE de Wan2.1, junto con una arquitectura DiT y una estrategia de entrenamiento multietapa basada en flow matching. La variante larga alcanza 85,14 puntos en VBench.
Como usar
Con Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained(
"ByteDance/ContentV-8B",
torch_dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Instalación desde el repositorio oficial:
git clone https://github.com/bytedance/ContentV.git
cd ContentV
pip3 install -r requirements.txt
Generación de texto a vídeo con GPU:
python3 demo.py
Se recomienda PyTorch 2.3.1 o posterior y CUDA 12.2 o posterior.
Funcionalidades
- Generación de vídeo a partir de texto mediante ContentVPipeline.
- 8.000 millones de parámetros con pesos BF16 en formato Safetensors.
- Arquitectura minimalista que reutiliza modelos preentrenados de generación de imágenes.
- Entrenamiento multietapa con flow matching para reducir el coste computacional.
- Optimización mediante RLHF sin anotaciones humanas adicionales.
- Puntuación VBench de 85,14 para ContentV Long y 84,11 para ContentV Short.
- Basado en Stable Diffusion 3.5 Large y el VAE de Wan2.1.
Casos de uso
- Crear vídeos a partir de descripciones textuales.
- Investigar arquitecturas DiT eficientes para generación de vídeo.
- Experimentar con entrenamiento de modelos de vídeo reutilizando modelos de imagen preentrenados.
- Evaluar sistemas de generación de vídeo con VBench.
- Desarrollar prototipos académicos o comerciales sujetos a las licencias de sus componentes.