UltraWan

APRIL-AIGC
Texto a video

Modelo de generación de vídeo a partir de texto ajustado sobre Wan2.1-T2V-1.3B. Permite crear vídeos de forma nativa en resoluciones 1K y 4K mediante adaptadores LoRA entrenados con el conjunto de datos UltraVideo, especializado en vídeo UHD con descripciones estructuradas detalladas.

Como usar

Instala DiffSynth y descarga tanto el modelo base Wan2.1 como los pesos de UltraWan:

pip install diffsynth==1.1.7
pip install "huggingface_hub[cli]"
huggingface-cli download --repo-type model Wan-AI/Wan2.1-T2V-1.3B --local-dir ultrawan_weights/Wan2.1-T2V-1.3B --resume-download
huggingface-cli download --repo-type model APRIL-AIGC/UltraWan --local-dir ultrawan_weights/UltraWan --resume-download

Generación 1K con una GPU:

CUDA_VISIBLE_DEVICES=0 python infer.py \
  --model_dir ultrawan_weights/Wan2.1-T2V-1.3B \
  --model_path ultrawan_weights/UltraWan/ultrawan-1k.ckpt \
  --mode lora --lora_alpha 0.25 --usp 0 \
  --height 1088 --width 1920 --num_frames 81 \
  --out_dir output/ultrawan-1k

Generación 4K con una GPU:

CUDA_VISIBLE_DEVICES=0 python infer.py \
  --model_dir ultrawan_weights/Wan2.1-T2V-1.3B \
  --model_path ultrawan_weights/UltraWan/ultrawan-4k.ckpt \
  --mode lora --lora_alpha 0.5 --usp 0 \
  --height 2160 --width 3840 --num_frames 33 \
  --out_dir output/ultrawan-4k

Para distribuir la inferencia entre seis GPU, utiliza torchrun y activa USP:

CUDA_VISIBLE_DEVICES=0,1,2,3,4,5 torchrun --standalone --nproc_per_node=6 infer.py \
  --model_dir ultrawan_weights/Wan2.1-T2V-1.3B \
  --model_path ultrawan_weights/UltraWan/ultrawan-4k.ckpt \
  --mode lora --lora_alpha 0.5 --usp 1 \
  --height 2160 --width 3840 --num_frames 33 \
  --out_dir output/ultrawan-4k

El uso de los modelos relacionados con Wan debe respetar la licencia Wan-Video/Wan2.1/LICENSE.txt.

Funcionalidades

Generación de vídeo a partir de texto en resolución nativa 1K y 4K.
Pesos LoRA específicos para generar vídeo a 1920×1088 y 3840×2160 píxeles.
Ejecución en una sola GPU o distribuida en seis GPU mediante USP y torchrun.
Basado en el modelo Wan2.1-T2V-1.3B.
Entrenado con UltraVideo, un conjunto de vídeos UHD 4K/8K acompañado de diez tipos de descripciones estructuradas.
Generación configurable mediante resolución, número de fotogramas y escala del adaptador LoRA.
No está desplegado actualmente mediante proveedores de inferencia de Hugging Face.

Casos de uso

Creación de vídeos UHD a partir de descripciones textuales.
Producción de clips 1K largos de hasta 81 fotogramas con los parámetros publicados.
Producción de clips 4K de hasta 33 fotogramas con los parámetros publicados.
Investigación sobre generación nativa de vídeo de alta resolución.
Evaluación de generación de vídeo con instrucciones inspiradas en VBench.
Prototipado de flujos audiovisuales ejecutados localmente en una o varias GPU.