Wan2.1-T2V-1.3B-longcat-step1000
lightx2v
Texto a video
Adaptador LoRA para Wan2.1-T2V-1.3B-Diffusers, ajustado durante 1.000 pasos mediante Group Relative Policy Optimization (GRPO) y optimización con múltiples recompensas. Genera vídeos de aproximadamente 5 segundos a partir de texto, con mejoras específicas en calidad estética, coherencia del movimiento y alineación semántica entre el prompt y el vídeo.
Como usar
Instala las dependencias:
pip install diffusers transformers accelerate torch
Carga el modelo base, aplica el adaptador LoRA y genera el vídeo:
import torch
from diffusers import WanPipeline
from diffusers.utils import export_to_video
# Cargar el modelo base
pipe = WanPipeline.from_pretrained(
"Wan-AI/Wan2.1-T2V-1.3B-Diffusers",
torch_dtype=torch.bfloat16,
device_map="auto"
)
# Cargar los pesos LoRA
pipe.load_lora_weights("lightx2v/Wan2.1-T2V-1.3B-longcat-step1000")
# Generar el vídeo
prompt = "A golden retriever playing in a sunny park, high quality, detailed"
video = pipe(
prompt=prompt,
height=480,
width=832,
num_frames=81,
num_inference_steps=50,
guidance_scale=4.5,
generator=torch.Generator().manual_seed(42)
).frames[0]
# Guardar el vídeo
export_to_video(video, "output.mp4", fps=16)
Funcionalidades
- Generación de vídeo a partir de texto mediante el modelo base Wan2.1-T2V-1.3B-Diffusers.
- Adaptador LoRA de rango 128 y alpha 64, entrenado durante 1.000 pasos.
- Salida optimizada para 480 × 832 píxeles, 81 fotogramas y aproximadamente 5 segundos a 16 fps.
- Optimización GRPO con recompensas HPSv3 para calidad estética y VideoAlign para movimiento y alineación texto-vídeo.
- Entrenamiento distribuido con 64 GPU A100/H100, FSDP, precisión bfloat16 y checkpointing de activaciones.
- Checkpoint intermedio que prioriza un equilibrio entre calidad de generación y tiempo de entrenamiento.
- Licencia MIT.
Casos de uso
- Crear clips breves de vídeo a partir de descripciones textuales.
- Prototipar escenas animadas con mayor coherencia de movimiento.
- Generar material visual para investigación sobre aprendizaje por refuerzo aplicado a modelos de difusión.
- Evaluar técnicas GRPO y estrategias de recompensa múltiple en generación de vídeo.
- Experimentar con adaptadores LoRA sobre Wan2.1 sin modificar todos los parámetros del modelo base.