EliasCarter/leoma-ti2v-5GuuFdC6e4GWcdTa3k78cbLqY6JtxcYtdHoadbAQgZiiTprs (Wan2.2 TI2V-5B)
EliasCarter
Texto a video
Modelo generativo de vídeo Wan2.2 de 5.000 millones de parámetros. Unifica la generación de texto a vídeo e imagen a vídeo, produce vídeo de 720p a 24 FPS y utiliza Wan2.2-VAE con alta compresión para ejecutarse en una sola GPU de consumo con al menos 24 GB de VRAM, como una RTX 4090. Se distribuye en formato Safetensors bajo la licencia Apache 2.0.
Como usar
Instalación y descarga del repositorio oficial:
git clone https://github.com/Wan-Video/Wan2.2.git
cd Wan2.2
pip install -r requirements.txt
pip install "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.2-TI2V-5B --local-dir ./Wan2.2-TI2V-5B
Generación de texto a vídeo en una GPU con al menos 24 GB de VRAM:
python generate.py \
--task ti2v-5B \
--size 1280*704 \
--ckpt_dir ./Wan2.2-TI2V-5B \
--offload_model True \
--convert_model_dtype \
--t5_cpu \
--prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage"
Para generar vídeo a partir de una imagen, se añade --image; si se omite, el modelo funciona en modo texto a vídeo:
python generate.py \
--task ti2v-5B \
--size 1280*704 \
--ckpt_dir ./Wan2.2-TI2V-5B \
--offload_model True \
--convert_model_dtype \
--t5_cpu \
--image examples/i2v_input.JPG \
--prompt "A white cat wearing sunglasses sits on a surfboard at a sunny beach"
Uso con Diffusers; la ficha indica que actualmente debe instalarse la rama principal desde GitHub:
pip install git+https://github.com/huggingface/diffusers
import torch
from diffusers import WanPipeline, AutoencoderKLWan
from diffusers.utils import export_to_video
model_id = "Wan-AI/Wan2.2-TI2V-5B-Diffusers"
vae = AutoencoderKLWan.from_pretrained(
model_id,
subfolder="vae",
torch_dtype=torch.float32,
)
pipe = WanPipeline.from_pretrained(
model_id,
vae=vae,
torch_dtype=torch.bfloat16,
).to("cuda")
frames = pipe(
prompt="Two anthropomorphic cats in boxing gear fight on a spotlighted stage.",
height=704,
width=1280,
num_frames=121,
guidance_scale=5.0,
num_inference_steps=50,
).frames[0]
export_to_video(frames, "wan2.2-ti2v-output.mp4", fps=24)
Funcionalidades
- Generación de texto a vídeo e imagen a vídeo en un único modelo.
- Salida de 720p a 24 fotogramas por segundo.
- 5.000 millones de parámetros con arquitectura densa.
- Wan2.2-VAE con compresión temporal y espacial de 4×16×16; con patchification, la compresión total alcanza 4×32×32.
- Inferencia en una sola GPU de consumo con al menos 24 GB de VRAM mediante descarga de componentes a CPU y conversión de tipos.
- Inferencia multi-GPU compatible con FSDP y DeepSpeed Ulysses.
- Entrenamiento ampliado respecto a Wan2.1 para mejorar movimiento, semántica y estética cinematográfica.
- Integración con Diffusers mediante WanPipeline.
- Pesos Safetensors con tipo de tensor F32.
Casos de uso
- Crear vídeos de 720p a partir de descripciones textuales.
- Animar una imagen de referencia conservando su relación de aspecto.
- Producir prototipos de escenas con movimiento complejo y estética cinematográfica controlable.
- Investigar modelos abiertos de difusión para generación de vídeo.
- Integrar generación local de vídeo en flujos creativos o industriales con GPU propia.