Wan2.1-Fun-1.3B-InP
DonatoDiffusion
Texto a video
Modelo de difusión de aproximadamente 2.000 millones de parámetros para generar vídeo a partir de texto e imágenes. Fue entrenado con múltiples resoluciones, admite imágenes de inicio y final para condicionar la secuencia y utiliza pesos BF16 en formato Safetensors.
Como usar
Instalación y carga básica con Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" en dispositivos Apple compatibles.
pipe = DiffusionPipeline.from_pretrained(
"DonatoDiffusion/Wan2.1-Fun-1.3B-InP",
torch_dtype=torch.bfloat16,
device_map="cuda",
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Para los flujos completos de vídeo, descarga los pesos en models/Diffusion_Transformer/Wan2.1-Fun-1.3B-InP/ y utiliza los scripts correspondientes de Wan-Fun. En equipos con poca VRAM se puede seleccionar model_cpu_offload, model_cpu_offload_and_qfloat8 o sequential_cpu_offload; el último ahorra más memoria, pero es más lento.
Funcionalidades
- Generación de vídeo a partir de texto.
- Generación de vídeo condicionada por una imagen inicial.
- Predicción de la transición entre una imagen inicial y una imagen final.
- Entrenamiento multirresolución.
- Compatibilidad con Diffusers y el proyecto Wan-Fun/CogVideoX-Fun.
- Modos de ahorro de memoria mediante descarga del modelo a CPU, cuantización Float8 o descarga secuencial por capas.
- Pesos de aproximadamente 19 GB bajo licencia Apache 2.0.
Casos de uso
- Crear clips de vídeo a partir de descripciones textuales.
- Animar una imagen fija manteniendo su composición como punto de partida.
- Generar una transición de vídeo entre fotogramas inicial y final definidos.
- Prototipar escenas audiovisuales, conceptos cinematográficos y contenido creativo con hardware de consumo.
- Integrar generación de vídeo en flujos locales basados en Diffusers, ComfyUI o Gradio.