UltraWan
APRIL-AIGC
Texto a video
Modelo de generación de vídeo a partir de texto ajustado sobre Wan2.1-T2V-1.3B. Permite crear vídeos de forma nativa en resoluciones 1K y 4K mediante adaptadores LoRA entrenados con el conjunto de datos UltraVideo, especializado en vídeo UHD con descripciones estructuradas detalladas.
Como usar
Instala DiffSynth y descarga tanto el modelo base Wan2.1 como los pesos de UltraWan:
pip install diffsynth==1.1.7
pip install "huggingface_hub[cli]"
huggingface-cli download --repo-type model Wan-AI/Wan2.1-T2V-1.3B --local-dir ultrawan_weights/Wan2.1-T2V-1.3B --resume-download
huggingface-cli download --repo-type model APRIL-AIGC/UltraWan --local-dir ultrawan_weights/UltraWan --resume-download
Generación 1K con una GPU:
CUDA_VISIBLE_DEVICES=0 python infer.py \
--model_dir ultrawan_weights/Wan2.1-T2V-1.3B \
--model_path ultrawan_weights/UltraWan/ultrawan-1k.ckpt \
--mode lora --lora_alpha 0.25 --usp 0 \
--height 1088 --width 1920 --num_frames 81 \
--out_dir output/ultrawan-1k
Generación 4K con una GPU:
CUDA_VISIBLE_DEVICES=0 python infer.py \
--model_dir ultrawan_weights/Wan2.1-T2V-1.3B \
--model_path ultrawan_weights/UltraWan/ultrawan-4k.ckpt \
--mode lora --lora_alpha 0.5 --usp 0 \
--height 2160 --width 3840 --num_frames 33 \
--out_dir output/ultrawan-4k
Para distribuir la inferencia entre seis GPU, utiliza torchrun y activa USP:
CUDA_VISIBLE_DEVICES=0,1,2,3,4,5 torchrun --standalone --nproc_per_node=6 infer.py \
--model_dir ultrawan_weights/Wan2.1-T2V-1.3B \
--model_path ultrawan_weights/UltraWan/ultrawan-4k.ckpt \
--mode lora --lora_alpha 0.5 --usp 1 \
--height 2160 --width 3840 --num_frames 33 \
--out_dir output/ultrawan-4k
El uso de los modelos relacionados con Wan debe respetar la licencia Wan-Video/Wan2.1/LICENSE.txt.
Funcionalidades
- Generación de vídeo a partir de texto en resolución nativa 1K y 4K.
- Pesos LoRA específicos para generar vídeo a 1920×1088 y 3840×2160 píxeles.
- Ejecución en una sola GPU o distribuida en seis GPU mediante USP y torchrun.
- Basado en el modelo Wan2.1-T2V-1.3B.
- Entrenado con UltraVideo, un conjunto de vídeos UHD 4K/8K acompañado de diez tipos de descripciones estructuradas.
- Generación configurable mediante resolución, número de fotogramas y escala del adaptador LoRA.
- No está desplegado actualmente mediante proveedores de inferencia de Hugging Face.
Casos de uso
- Creación de vídeos UHD a partir de descripciones textuales.
- Producción de clips 1K largos de hasta 81 fotogramas con los parámetros publicados.
- Producción de clips 4K de hasta 33 fotogramas con los parámetros publicados.
- Investigación sobre generación nativa de vídeo de alta resolución.
- Evaluación de generación de vídeo con instrucciones inspiradas en VBench.
- Prototipado de flujos audiovisuales ejecutados localmente en una o varias GPU.