Wan2.2-VACE-Fun-A14B

qqceqqq
Texto a video

Modelo de generación y control de vídeo de 14.000 millones de parámetros, ajustado con el enfoque VACE sobre Wan2.2-T2V-A14B. Genera vídeos condicionados por imágenes de referencia, sujetos y señales como Canny, profundidad, pose, MLSD o trayectorias. Admite resoluciones de 512, 768 y 1024 píxeles y fue entrenado con secuencias de 81 fotogramas a 16 FPS.

Como usar

Puede ejecutarse con VideoX-Fun mediante Docker, ComfyUI o scripts locales de Python. Para iniciar el entorno Docker y descargar el repositorio:

# Descargar la imagen
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun

# Iniciar el contenedor
docker run -it -p 7860:7860 --network host --gpus all --security-opt seccomp:unconfined --shm-size 200g mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun

# Clonar VideoX-Fun
git clone https://github.com/aigc-apps/VideoX-Fun.git
cd VideoX-Fun

# Crear los directorios para los pesos
mkdir models/Diffusion_Transformer
mkdir models/Personalized_Model

Después, descargue los pesos del modelo y colóquelos en models/Diffusion_Transformer/. Seleccione el script correspondiente dentro de examples/ y configure el prompt, el prompt negativo, la escala de guía, la semilla y las entradas de control. Para reducir el consumo de VRAM puede usar model_cpu_offload, model_cpu_offload_and_qfloat8 o sequential_cpu_offload; la cuantización float8 ahorra más memoria, aunque puede reducir la calidad. Se requieren aproximadamente 60 GB de espacio libre y una instalación compatible de CUDA.

Funcionalidades

Generación de texto a vídeo y vídeo controlado
Condicionamiento mediante Canny, profundidad, pose y MLSD
Control de movimiento mediante trayectorias
Generación guiada por una imagen o un sujeto de referencia
Compatibilidad con resoluciones de 512, 768 y 1024 píxeles
Secuencias de 81 fotogramas a 16 FPS
Modos de ahorro de VRAM mediante descarga a CPU y cuantización float8
Integración con VideoX-Fun, ComfyUI, interfaces Gradio y Docker
Pesos de aproximadamente 64 GB
Licencia Apache 2.0

Casos de uso

Crear vídeos a partir de descripciones textuales
Animar una imagen o un sujeto de referencia
Generar vídeo siguiendo la pose o el movimiento de una grabación de control
Aplicar estructura visual mediante mapas Canny, profundidad o líneas MLSD
Dirigir movimientos mediante trayectorias definidas
Producir variaciones controladas de un vídeo existente
Crear secuencias de vídeo multilingües con control espacial y temporal