SFWan2.1-T2V-1.3B-Diffusers

wlsaidhi
Texto a video

Modelo de difusión de texto a vídeo basado en Wan2.1-T2V con aproximadamente 1.300 millones de parámetros y formato compatible con Diffusers. Genera vídeos de 480p a partir de instrucciones en lenguaje natural y está diseñado para funcionar en GPU de consumo; la documentación indica unos 8,19 GB de VRAM y recomienda 480p por su mayor estabilidad frente a 720p.

Como usar

Instala las dependencias y ejecuta el modelo con Diffusers. Este ejemplo genera 81 fotogramas a 480p y exporta el resultado como un vídeo MP4:

pip install -U diffusers transformers accelerate
import torch
from diffusers import AutoencoderKLWan, WanPipeline
from diffusers.utils import export_to_video

model_id = "wlsaidhi/SFWan2.1-T2V-1.3B-Diffusers"

vae = AutoencoderKLWan.from_pretrained(
    model_id,
    subfolder="vae",
    torch_dtype=torch.float32,
)

pipe = WanPipeline.from_pretrained(
    model_id,
    vae=vae,
    torch_dtype=torch.bfloat16,
)
pipe.to("cuda")

prompt = "Un gato camina sobre la hierba, estilo realista"
negative_prompt = (
    "tonos demasiado brillantes, sobreexposición, imagen estática, "
    "detalles borrosos, subtítulos, baja calidad, deformidades"
)

frames = pipe(
    prompt=prompt,
    negative_prompt=negative_prompt,
    height=480,
    width=832,
    num_frames=81,
    guidance_scale=5.0,
).frames[0]

export_to_video(frames, "output.mp4", fps=15)

Para la implementación original de Wan2.1, se recomienda --sample_guide_scale 6 y un valor de --sample_shift entre 8 y 12. Si la GPU se queda sin memoria, pueden añadirse --offload_model True y --t5_cpu.

Funcionalidades

Generación de vídeo a partir de texto
Arquitectura Diffusion Transformer con Flow Matching
Codificación de instrucciones multilingües mediante T5
VAE causal 3D para conservar la coherencia temporal
Compatibilidad con Hugging Face Diffusers
Generación recomendada a 832 × 480 píxeles
Ejecución en una sola GPU con descarga del modelo y T5 en CPU para reducir memoria
Inferencia distribuida mediante FSDP y xDiT USP
Ampliación opcional de instrucciones con DashScope o modelos Qwen locales
Pesos Safetensors y licencia Apache 2.0

Casos de uso

Creación de clips de vídeo de cinco segundos a partir de descripciones textuales
Prototipado visual y previsualización de escenas
Producción de contenido audiovisual para equipos creativos con GPU de consumo
Investigación académica sobre generación de vídeo mediante modelos de difusión
Generación de escenas con texto visual en chino o inglés
Integración local de generación de vídeo en aplicaciones basadas en Diffusers