SFWan2.1-T2V-1.3B-Diffusers
wlsaidhi
Texto a video
Modelo de difusión de texto a vídeo basado en Wan2.1-T2V con aproximadamente 1.300 millones de parámetros y formato compatible con Diffusers. Genera vídeos de 480p a partir de instrucciones en lenguaje natural y está diseñado para funcionar en GPU de consumo; la documentación indica unos 8,19 GB de VRAM y recomienda 480p por su mayor estabilidad frente a 720p.
Como usar
Instala las dependencias y ejecuta el modelo con Diffusers. Este ejemplo genera 81 fotogramas a 480p y exporta el resultado como un vídeo MP4:
pip install -U diffusers transformers accelerate
import torch
from diffusers import AutoencoderKLWan, WanPipeline
from diffusers.utils import export_to_video
model_id = "wlsaidhi/SFWan2.1-T2V-1.3B-Diffusers"
vae = AutoencoderKLWan.from_pretrained(
model_id,
subfolder="vae",
torch_dtype=torch.float32,
)
pipe = WanPipeline.from_pretrained(
model_id,
vae=vae,
torch_dtype=torch.bfloat16,
)
pipe.to("cuda")
prompt = "Un gato camina sobre la hierba, estilo realista"
negative_prompt = (
"tonos demasiado brillantes, sobreexposición, imagen estática, "
"detalles borrosos, subtítulos, baja calidad, deformidades"
)
frames = pipe(
prompt=prompt,
negative_prompt=negative_prompt,
height=480,
width=832,
num_frames=81,
guidance_scale=5.0,
).frames[0]
export_to_video(frames, "output.mp4", fps=15)
Para la implementación original de Wan2.1, se recomienda --sample_guide_scale 6 y un valor de --sample_shift entre 8 y 12. Si la GPU se queda sin memoria, pueden añadirse --offload_model True y --t5_cpu.
Funcionalidades
- Generación de vídeo a partir de texto
- Arquitectura Diffusion Transformer con Flow Matching
- Codificación de instrucciones multilingües mediante T5
- VAE causal 3D para conservar la coherencia temporal
- Compatibilidad con Hugging Face Diffusers
- Generación recomendada a 832 × 480 píxeles
- Ejecución en una sola GPU con descarga del modelo y T5 en CPU para reducir memoria
- Inferencia distribuida mediante FSDP y xDiT USP
- Ampliación opcional de instrucciones con DashScope o modelos Qwen locales
- Pesos Safetensors y licencia Apache 2.0
Casos de uso
- Creación de clips de vídeo de cinco segundos a partir de descripciones textuales
- Prototipado visual y previsualización de escenas
- Producción de contenido audiovisual para equipos creativos con GPU de consumo
- Investigación académica sobre generación de vídeo mediante modelos de difusión
- Generación de escenas con texto visual en chino o inglés
- Integración local de generación de vídeo en aplicaciones basadas en Diffusers