APRIL-AIGC/T3-Video

APRIL-AIGC
Texto a video

Modelo de difusión de texto a vídeo basado en Wan2.1 y Wan2.2, diseñado para acelerar más de 10 veces la generación nativa de vídeo 4K. Incluye variantes de 1,3B y 5B parámetros y genera secuencias de hasta 3840 × 2176 píxeles y 81 fotogramas. Publicado por APRIL-AIGC bajo licencia Apache 2.0, con condiciones adicionales de la licencia de Wan para los modelos relacionados.

Como usar

Instalación y carga básica mediante Diffusers:

pip install -U diffusers transformers accelerate

import torch
from diffusers import DiffusionPipeline

# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "APRIL-AIGC/T3-Video",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Descarga de los modelos base y de T3-Video:

pip install "huggingface_hub[cli]"

huggingface-cli download --repo-type model Wan-AI/Wan2.1-T2V-1.3B \
  --local-dir weights/Wan2.1-T2V-1.3B --resume-download

huggingface-cli download --repo-type model Wan-AI/Wan2.2-TI2V-5B \
  --local-dir weights/Wan2.2-TI2V-5B --resume-download

huggingface-cli download --repo-type model APRIL-AIGC/T3-Video \
  --local-dir weights/T3-Video --resume-download

Inferencia 4K con la variante Wan2.1 de 1,3B parámetros:

python infer_multi_gpu.py \
  --model_id Wan-AI/Wan2.1-T2V-1.3B \
  --text_path models/Wan2.1-T2V-1.3B/models_t5_umt5-xxl-enc-bf16.pth \
  --dit_path "models/Wan2.1-T2V-1.3B/diffusion_pytorch_model*.safetensors" \
  --vae_path models/Wan2.1-T2V-1.3B/Wan2.1_VAE.pth \
  --dit_path_full_pretrained models/T3-Video/T3-Video-Wan2.1-T2V-1.3B.safetensors \
  --height 2176 --width 3840 --num_frames 81 \
  --out_dir output/T3-Video-Wan2.1-T2V-1.3B-4K-World-Vision-seed0-step50 \
  --json_file 4K-World-Vision/4K-World-Vision.json \
  --data_root 4K-World-Vision \
  --start_id=0 --end_id=-1 --tiled true --seed 0 \
  --num_groups 8 --num_inference_steps 50

Para la variante Wan2.2 de 5B, la documentación indica cambiar el modo a wan2.2_2176_3840 en la línea 180 de diffsynth/models/wan_video_dit.py antes de ejecutar la inferencia. La tarjeta también presenta una advertencia de configuración JSON inválida y señala que parte del código y de los pesos aún está pendiente de publicación.

Funcionalidades

Generación de vídeo 4K nativo a partir de texto
Arquitectura Transform Trained Transformer orientada a acelerar la generación 4K
Variantes T3-Video-Wan2.1-T2V-1.3B y T3-Video-Wan2.2-T2V-5B
Compatibilidad declarada con Diffusers y DiffSynth-Studio
Inferencia distribuida en varias GPU
Procesamiento por mosaicos para reducir los requisitos de memoria
Configuración de resolución, fotogramas, semilla y pasos de inferencia
Entrenado con el conjunto de datos APRIL-AIGC/UltraVideo
Pesos, código de inferencia, código de entrenamiento y benchmarks todavía marcados parcialmente como pendientes de publicación

Casos de uso

Creación de vídeos cinematográficos 4K a partir de descripciones textuales
Generación de clips de alta resolución para producción audiovisual y publicidad
Prototipado de escenas, conceptos visuales y secuencias narrativas
Investigación sobre generación de vídeo mediante modelos de difusión y Transformers
Evaluación de modelos de texto a vídeo con el benchmark 4K-VBench
Generación por lotes en infraestructura con varias GPU