AaronHuangWei/Wan2.1-T2V-1.3B-NVFP4RealQuant_weightnoly

AaronHuangWei
Texto a video

Versión cuantizada solo en pesos de Wan2.1-T2V-1.3B para generar vídeos a partir de texto. Emplea una arquitectura Diffusion Transformer con Flow Matching, codificación textual multilingüe mediante T5 y el VAE causal 3D Wan-VAE. Está orientada principalmente a vídeo de 480p y utiliza pesos comprimidos NVFP4/8-bit para reducir los requisitos de almacenamiento y ejecución.

Como usar

Instalación y carga mediante Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# Cambia a "mps" en dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "AaronHuangWei/Wan2.1-T2V-1.3B-NVFP4RealQuant_weightnoly",
    dtype=torch.bfloat16,
    device_map="cuda",
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

El repositorio original de Wan2.1 también permite generar vídeo desde la línea de comandos:

python generate.py \
  --task t2v-1.3B \
  --size 832*480 \
  --ckpt_dir ./Wan2.1-T2V-1.3B \
  --sample_shift 8 \
  --sample_guide_scale 6 \
  --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."

Para reducir el consumo de memoria en una RTX 4090:

python generate.py \
  --task t2v-1.3B \
  --size 832*480 \
  --ckpt_dir ./Wan2.1-T2V-1.3B \
  --offload_model True \
  --t5_cpu \
  --sample_shift 8 \
  --sample_guide_scale 6 \
  --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."

Para el modelo de 1.3B se recomienda --sample_guide_scale 6 y un valor de --sample_shift entre 8 y 12. El ejemplo de Diffusers mostrado en la página accede a .images[0], aunque el modelo está etiquetado como texto a vídeo; conviene comprobar la versión de Diffusers y la salida real de esta variante cuantizada.

Funcionalidades

Generación de vídeo a partir de descripciones de texto.
Cuantización solo de pesos con NVFP4RealQuant y compressed-tensors.
Modelo compacto de la familia Wan2.1, concebido para funcionar en GPU de consumo.
Resolución recomendada de 480p; puede producir 720p, aunque con menor estabilidad.
Comprensión de indicaciones en inglés y chino, incluida la generación visual de texto en ambos idiomas.
Wan-VAE causal 3D para conservar la coherencia temporal del vídeo.
Admite inferencia en una o varias GPU mediante FSDP y xDiT USP.
Permite ampliar automáticamente las indicaciones mediante DashScope o modelos Qwen locales.
Licencia Apache 2.0.

Casos de uso

Creación de clips de vídeo de 480p a partir de descripciones textuales.
Prototipado de herramientas creativas de texto a vídeo en GPU de consumo.
Producción de animaciones, escenas cinematográficas y contenido visual generado.
Investigación sobre generación de vídeo con modelos Diffusion Transformer cuantizados.
Integración en flujos locales mediante Diffusers, scripts de Wan2.1, Gradio o ComfyUI.
Generación de escenas que incorporen texto visual en inglés o chino.