Wan2.1-Fun-1.3B-InP

DonatoDiffusion
Texto a video

Modelo de difusión de aproximadamente 2.000 millones de parámetros para generar vídeo a partir de texto e imágenes. Fue entrenado con múltiples resoluciones, admite imágenes de inicio y final para condicionar la secuencia y utiliza pesos BF16 en formato Safetensors.

Como usar

Instalación y carga básica con Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# Cambia a "mps" en dispositivos Apple compatibles.
pipe = DiffusionPipeline.from_pretrained(
    "DonatoDiffusion/Wan2.1-Fun-1.3B-InP",
    torch_dtype=torch.bfloat16,
    device_map="cuda",
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Para los flujos completos de vídeo, descarga los pesos en models/Diffusion_Transformer/Wan2.1-Fun-1.3B-InP/ y utiliza los scripts correspondientes de Wan-Fun. En equipos con poca VRAM se puede seleccionar model_cpu_offload, model_cpu_offload_and_qfloat8 o sequential_cpu_offload; el último ahorra más memoria, pero es más lento.

Funcionalidades

Generación de vídeo a partir de texto.
Generación de vídeo condicionada por una imagen inicial.
Predicción de la transición entre una imagen inicial y una imagen final.
Entrenamiento multirresolución.
Compatibilidad con Diffusers y el proyecto Wan-Fun/CogVideoX-Fun.
Modos de ahorro de memoria mediante descarga del modelo a CPU, cuantización Float8 o descarga secuencial por capas.
Pesos de aproximadamente 19 GB bajo licencia Apache 2.0.

Casos de uso

Crear clips de vídeo a partir de descripciones textuales.
Animar una imagen fija manteniendo su composición como punto de partida.
Generar una transición de vídeo entre fotogramas inicial y final definidos.
Prototipar escenas audiovisuales, conceptos cinematográficos y contenido creativo con hardware de consumo.
Integrar generación de vídeo en flujos locales basados en Diffusers, ComfyUI o Gradio.