Wan2.1-T2V-1.3B-longcat-step1000

lightx2v
Texto a video

Adaptador LoRA para Wan2.1-T2V-1.3B-Diffusers, ajustado durante 1.000 pasos mediante Group Relative Policy Optimization (GRPO) y optimización con múltiples recompensas. Genera vídeos de aproximadamente 5 segundos a partir de texto, con mejoras específicas en calidad estética, coherencia del movimiento y alineación semántica entre el prompt y el vídeo.

Como usar

Instala las dependencias:

pip install diffusers transformers accelerate torch

Carga el modelo base, aplica el adaptador LoRA y genera el vídeo:

import torch
from diffusers import WanPipeline
from diffusers.utils import export_to_video

# Cargar el modelo base
pipe = WanPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

# Cargar los pesos LoRA
pipe.load_lora_weights("lightx2v/Wan2.1-T2V-1.3B-longcat-step1000")

# Generar el vídeo
prompt = "A golden retriever playing in a sunny park, high quality, detailed"
video = pipe(
    prompt=prompt,
    height=480,
    width=832,
    num_frames=81,
    num_inference_steps=50,
    guidance_scale=4.5,
    generator=torch.Generator().manual_seed(42)
).frames[0]

# Guardar el vídeo
export_to_video(video, "output.mp4", fps=16)

Funcionalidades

Generación de vídeo a partir de texto mediante el modelo base Wan2.1-T2V-1.3B-Diffusers.
Adaptador LoRA de rango 128 y alpha 64, entrenado durante 1.000 pasos.
Salida optimizada para 480 × 832 píxeles, 81 fotogramas y aproximadamente 5 segundos a 16 fps.
Optimización GRPO con recompensas HPSv3 para calidad estética y VideoAlign para movimiento y alineación texto-vídeo.
Entrenamiento distribuido con 64 GPU A100/H100, FSDP, precisión bfloat16 y checkpointing de activaciones.
Checkpoint intermedio que prioriza un equilibrio entre calidad de generación y tiempo de entrenamiento.
Licencia MIT.

Casos de uso

Crear clips breves de vídeo a partir de descripciones textuales.
Prototipar escenas animadas con mayor coherencia de movimiento.
Generar material visual para investigación sobre aprendizaje por refuerzo aplicado a modelos de difusión.
Evaluar técnicas GRPO y estrategias de recompensa múltiple en generación de vídeo.
Experimentar con adaptadores LoRA sobre Wan2.1 sin modificar todos los parámetros del modelo base.