OpenS2V-Weight
BestWishYsh
Texto a video
Modelo de generación de vídeo condicionado por un sujeto, publicado como parte de OpenS2V-Nexus. Está basado en Wan2.1-T2V-14B y se relaciona con OpenS2V-5M, un conjunto de datos a gran escala, y OpenS2V-Eval, un banco de pruebas para evaluar modelos de generación de sujeto a vídeo.
Como usar
Instala las dependencias y carga el modelo mediante Diffusers. El ejemplo publicado genera una salida a partir de una descripción textual:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"BestWishYsh/OpenS2V-Weight",
dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Aunque la página clasifica el modelo como texto a vídeo, el fragmento proporcionado accede a images[0]; conviene consultar el repositorio del proyecto para confirmar el formato de salida y el flujo específico de generación de vídeo.
Funcionalidades
- Generación de texto a vídeo centrada en conservar y animar un sujeto de referencia.
- Basado en el modelo Wan-AI/Wan2.1-T2V-14B.
- Compatible con la biblioteca Diffusers.
- Pesos disponibles también en variantes cuantizadas.
- Vinculado a OpenS2V-Eval, que incorpora métricas automáticas alineadas con la percepción humana.
- Desarrollado junto con OpenS2V-5M, que contiene 5,1 millones de muestras convencionales y 350.000 muestras Nexus.
- Distribuido con licencia Apache 2.0.
Casos de uso
- Crear vídeos en los que un sujeto concreto conserve su identidad visual entre fotogramas.
- Investigar la generación de sujeto a vídeo y sus principales problemas de consistencia.
- Comparar modelos mediante el banco de pruebas OpenS2V-Eval.
- Experimentar con generación audiovisual condicionada por descripciones textuales.
- Evaluar variantes cuantizadas de un modelo de vídeo basado en Wan2.1-T2V-14B.