APRIL-AIGC/T3-Video
Modelo de difusión de texto a vídeo basado en Wan2.1 y Wan2.2, diseñado para acelerar más de 10 veces la generación nativa de vídeo 4K. Incluye variantes de 1,3B y 5B parámetros y genera secuencias de hasta 3840 × 2176 píxeles y 81 fotogramas. Publicado por APRIL-AIGC bajo licencia Apache 2.0, con condiciones adicionales de la licencia de Wan para los modelos relacionados.
Como usar
Instalación y carga básica mediante Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"APRIL-AIGC/T3-Video",
torch_dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Descarga de los modelos base y de T3-Video:
pip install "huggingface_hub[cli]"
huggingface-cli download --repo-type model Wan-AI/Wan2.1-T2V-1.3B \
--local-dir weights/Wan2.1-T2V-1.3B --resume-download
huggingface-cli download --repo-type model Wan-AI/Wan2.2-TI2V-5B \
--local-dir weights/Wan2.2-TI2V-5B --resume-download
huggingface-cli download --repo-type model APRIL-AIGC/T3-Video \
--local-dir weights/T3-Video --resume-download
Inferencia 4K con la variante Wan2.1 de 1,3B parámetros:
python infer_multi_gpu.py \
--model_id Wan-AI/Wan2.1-T2V-1.3B \
--text_path models/Wan2.1-T2V-1.3B/models_t5_umt5-xxl-enc-bf16.pth \
--dit_path "models/Wan2.1-T2V-1.3B/diffusion_pytorch_model*.safetensors" \
--vae_path models/Wan2.1-T2V-1.3B/Wan2.1_VAE.pth \
--dit_path_full_pretrained models/T3-Video/T3-Video-Wan2.1-T2V-1.3B.safetensors \
--height 2176 --width 3840 --num_frames 81 \
--out_dir output/T3-Video-Wan2.1-T2V-1.3B-4K-World-Vision-seed0-step50 \
--json_file 4K-World-Vision/4K-World-Vision.json \
--data_root 4K-World-Vision \
--start_id=0 --end_id=-1 --tiled true --seed 0 \
--num_groups 8 --num_inference_steps 50
Para la variante Wan2.2 de 5B, la documentación indica cambiar el modo a wan2.2_2176_3840 en la línea 180 de diffsynth/models/wan_video_dit.py antes de ejecutar la inferencia. La tarjeta también presenta una advertencia de configuración JSON inválida y señala que parte del código y de los pesos aún está pendiente de publicación.
Funcionalidades
- Generación de vídeo 4K nativo a partir de texto
- Arquitectura Transform Trained Transformer orientada a acelerar la generación 4K
- Variantes T3-Video-Wan2.1-T2V-1.3B y T3-Video-Wan2.2-T2V-5B
- Compatibilidad declarada con Diffusers y DiffSynth-Studio
- Inferencia distribuida en varias GPU
- Procesamiento por mosaicos para reducir los requisitos de memoria
- Configuración de resolución, fotogramas, semilla y pasos de inferencia
- Entrenado con el conjunto de datos APRIL-AIGC/UltraVideo
- Pesos, código de inferencia, código de entrenamiento y benchmarks todavía marcados parcialmente como pendientes de publicación
Casos de uso
- Creación de vídeos cinematográficos 4K a partir de descripciones textuales
- Generación de clips de alta resolución para producción audiovisual y publicidad
- Prototipado de escenas, conceptos visuales y secuencias narrativas
- Investigación sobre generación de vídeo mediante modelos de difusión y Transformers
- Evaluación de modelos de texto a vídeo con el benchmark 4K-VBench
- Generación por lotes en infraestructura con varias GPU