Wan2.1-Fun-1.3B-Control

DonatoDiffusion
Texto a video

Modelo de difusión de aproximadamente 2.000 millones de parámetros para generar vídeos condicionados por señales de control. Admite controles Canny, profundidad, pose, MLSD y trayectorias, con predicción multirresolución a 512, 768 y 1024 píxeles. Fue entrenado con secuencias de 81 fotogramas a 16 FPS y utiliza pesos BF16 en formato Safetensors.

Como usar

Instala las dependencias y carga el modelo mediante Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# Cambia "cuda" por "mps" en dispositivos Apple compatibles.
pipe = DiffusionPipeline.from_pretrained(
    "DonatoDiffusion/Wan2.1-Fun-1.3B-Control",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Para el flujo completo de vídeo controlado, descarga los pesos en models/Diffusion_Transformer/ y utiliza el script de predicción de control correspondiente dentro de examples. El vídeo de control debe haberse procesado previamente con una señal como Canny, Pose, Depth o MLSD. Ajusta parámetros como control_video, prompt, neg_prompt, guidance_scale y seed antes de ejecutar el script.

En equipos con VRAM limitada pueden seleccionarse los modos model_cpu_offload, model_cpu_offload_and_qfloat8 o sequential_cpu_offload. La cuantización Float8 reduce más el consumo de memoria, aunque puede disminuir parcialmente la calidad o el rendimiento del modelo.

Funcionalidades

Generación de vídeo mediante condiciones de control visual.
Compatibilidad con mapas Canny, profundidad, pose y líneas MLSD.
Control del movimiento mediante trayectorias.
Predicción de vídeo en resoluciones de 512, 768 y 1024 píxeles.
Entrenamiento con vídeos de 81 fotogramas a 16 FPS.
Soporte para instrucciones en varios idiomas.
Modos de ahorro de VRAM mediante descarga del modelo a CPU, cuantización Float8 o descarga secuencial por capas.
Integración con Diffusers, ComfyUI, Gradio y flujos locales basados en Python.
Pesos BF16 en formato Safetensors bajo licencia Apache 2.0.

Casos de uso

Transformar un vídeo de referencia conservando su estructura de movimiento o composición.
Generar animaciones guiadas por esqueletos de pose humana.
Crear vídeos condicionados por mapas de profundidad para mantener la geometría de una escena.
Controlar contornos y composición mediante mapas Canny o MLSD.
Dirigir el desplazamiento de sujetos u objetos mediante trayectorias.
Producir clips multirresolución a partir de instrucciones textuales y señales visuales de control.
Integrar generación de vídeo controlada en interfaces de ComfyUI o Gradio.