Wan2.1-T2V-1.3B LongCat LoRA — Paso 500

lightx2v
Texto a video

Adaptador LoRA para Wan2.1-T2V-1.3B-Diffusers, ajustado durante 500 pasos mediante GRPO y optimización con múltiples recompensas. Genera vídeos de aproximadamente cinco segundos, con 81 fotogramas a 16 fps y una resolución objetivo de 480 × 832 píxeles.

Como usar

Instalación:

pip install -U diffusers transformers accelerate torch

Ejemplo de inferencia:

import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video

pipe = DiffusionPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)
pipe.load_lora_weights("lightx2v/Wan2.1-T2V-1.3B-longcat-step500")

prompt = "A man with short gray hair plays a red electric guitar."
output = pipe(
    prompt=prompt,
    height=480,
    width=832,
    num_frames=81,
    num_inference_steps=50,
    guidance_scale=4.5,
    generator=torch.Generator().manual_seed(42)
).frames[0]

export_to_video(output, "output.mp4", fps=16)

Funcionalidades

Adaptador LoRA de rango 128 y alfa 64 para el modelo base Wan2.1-T2V-1.3B-Diffusers.
Optimizado conjuntamente para calidad estética, coherencia del movimiento y correspondencia semántica entre texto y vídeo.
Entrenado con GRPO usando HPSv3 y VideoAlign como funciones de recompensa.
Generación objetivo de 81 fotogramas a 480 × 832 píxeles, equivalente a unos cinco segundos a 16 fps.
Checkpoint temprano de 500 pasos que muestra mejoras iniciales, aunque los checkpoints de 1000 o 1500 pasos pueden ofrecer mejores resultados.
Publicado bajo licencia MIT.

Casos de uso

Generar vídeos cortos a partir de descripciones textuales.
Crear secuencias con mayor coherencia de movimiento que el modelo base sin ajustar.
Producir clips donde el contenido visual mantenga una mejor correspondencia con el prompt.
Experimentar con generación de vídeo mediante LoRA y aprendizaje por refuerzo GRPO.
Investigar optimización multirrecompensa para modelos generativos visuales.