VidToMe

jadechoghari
Texto a video

Pipeline de edición de vídeo zero-shot basada en difusión que fusiona tokens de autoatención entre fotogramas para mejorar la coherencia temporal y reducir el consumo de memoria. Permite transformar vídeos mediante instrucciones de texto sin ajustar previamente el modelo.

Como usar

Instala las dependencias y carga el pipeline personalizado con Diffusers. Define una descripción del vídeo original y uno o varios prompts de edición antes de procesar el archivo.

pip install -U diffusers transformers accelerate
from diffusers import DiffusionPipeline

# Cargar el modelo preentrenado
pipeline = DiffusionPipeline.from_pretrained(
    "jadechoghari/VidToMe",
    trust_remote_code=True,
    custom_pipeline="jadechoghari/VidToMe",
    sd_version="depth",
    device="cuda",
    float_precision="fp16"
)

# Definir los prompts de inversión y generación
inversion_prompt = "flamingos standing in the water near a tree."
generation_prompt = {
    "origami": "rainbow-colored origami flamingos standing in the water near a tree."
}

# Configurar controles y parámetros adicionales
control_type = "none"  # Usar "depth" si se necesita control por profundidad
negative_prompt = ""

# Ejecutar el pipeline de edición de vídeo
generated_images = pipeline(
    video_path="path/to/video.mp4",
    video_prompt=inversion_prompt,
    edit_prompt=generation_prompt,
    control_type=control_type
)

Funcionalidades

Edición de vídeo zero-shot mediante instrucciones en lenguaje natural
Fusión y compresión de tokens redundantes entre fotogramas
Mayor coherencia temporal y transiciones más fluidas
Menor uso de memoria en secuencias largas o complejas
Control opcional mediante mapas de profundidad
Integración con la biblioteca Diffusers

Casos de uso

Transformar el estilo o contenido de un vídeo con prompts de texto
Editar vídeos sin entrenamiento ni ajuste específico
Crear variaciones visuales coherentes para producción de contenido
Procesar secuencias largas con un uso de memoria optimizado