VidToMe
jadechoghari
Texto a video
Pipeline de edición de vídeo zero-shot basada en difusión que fusiona tokens de autoatención entre fotogramas para mejorar la coherencia temporal y reducir el consumo de memoria. Permite transformar vídeos mediante instrucciones de texto sin ajustar previamente el modelo.
Como usar
Instala las dependencias y carga el pipeline personalizado con Diffusers. Define una descripción del vídeo original y uno o varios prompts de edición antes de procesar el archivo.
pip install -U diffusers transformers accelerate
from diffusers import DiffusionPipeline
# Cargar el modelo preentrenado
pipeline = DiffusionPipeline.from_pretrained(
"jadechoghari/VidToMe",
trust_remote_code=True,
custom_pipeline="jadechoghari/VidToMe",
sd_version="depth",
device="cuda",
float_precision="fp16"
)
# Definir los prompts de inversión y generación
inversion_prompt = "flamingos standing in the water near a tree."
generation_prompt = {
"origami": "rainbow-colored origami flamingos standing in the water near a tree."
}
# Configurar controles y parámetros adicionales
control_type = "none" # Usar "depth" si se necesita control por profundidad
negative_prompt = ""
# Ejecutar el pipeline de edición de vídeo
generated_images = pipeline(
video_path="path/to/video.mp4",
video_prompt=inversion_prompt,
edit_prompt=generation_prompt,
control_type=control_type
)
Funcionalidades
- Edición de vídeo zero-shot mediante instrucciones en lenguaje natural
- Fusión y compresión de tokens redundantes entre fotogramas
- Mayor coherencia temporal y transiciones más fluidas
- Menor uso de memoria en secuencias largas o complejas
- Control opcional mediante mapas de profundidad
- Integración con la biblioteca Diffusers
Casos de uso
- Transformar el estilo o contenido de un vídeo con prompts de texto
- Editar vídeos sin entrenamiento ni ajuste específico
- Crear variaciones visuales coherentes para producción de contenido
- Procesar secuencias largas con un uso de memoria optimizado