Wan2.1-T2V-1.3B LongCat LoRA — Paso 500
lightx2v
Texto a video
Adaptador LoRA para Wan2.1-T2V-1.3B-Diffusers, ajustado durante 500 pasos mediante GRPO y optimización con múltiples recompensas. Genera vídeos de aproximadamente cinco segundos, con 81 fotogramas a 16 fps y una resolución objetivo de 480 × 832 píxeles.
Como usar
Instalación:
pip install -U diffusers transformers accelerate torch
Ejemplo de inferencia:
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video
pipe = DiffusionPipeline.from_pretrained(
"Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
torch_dtype=torch.bfloat16,
device_map="cuda"
)
pipe.load_lora_weights("lightx2v/Wan2.1-T2V-1.3B-longcat-step500")
prompt = "A man with short gray hair plays a red electric guitar."
output = pipe(
prompt=prompt,
height=480,
width=832,
num_frames=81,
num_inference_steps=50,
guidance_scale=4.5,
generator=torch.Generator().manual_seed(42)
).frames[0]
export_to_video(output, "output.mp4", fps=16)
Funcionalidades
- Adaptador LoRA de rango 128 y alfa 64 para el modelo base Wan2.1-T2V-1.3B-Diffusers.
- Optimizado conjuntamente para calidad estética, coherencia del movimiento y correspondencia semántica entre texto y vídeo.
- Entrenado con GRPO usando HPSv3 y VideoAlign como funciones de recompensa.
- Generación objetivo de 81 fotogramas a 480 × 832 píxeles, equivalente a unos cinco segundos a 16 fps.
- Checkpoint temprano de 500 pasos que muestra mejoras iniciales, aunque los checkpoints de 1000 o 1500 pasos pueden ofrecer mejores resultados.
- Publicado bajo licencia MIT.
Casos de uso
- Generar vídeos cortos a partir de descripciones textuales.
- Crear secuencias con mayor coherencia de movimiento que el modelo base sin ajustar.
- Producir clips donde el contenido visual mantenga una mejor correspondencia con el prompt.
- Experimentar con generación de vídeo mediante LoRA y aprendizaje por refuerzo GRPO.
- Investigar optimización multirrecompensa para modelos generativos visuales.