Wan2.2-VACE-Fun-A14B
Modelo de generación y control de vídeo de 14.000 millones de parámetros, ajustado con el enfoque VACE sobre Wan2.2-T2V-A14B. Genera vídeos condicionados por imágenes de referencia, sujetos y señales como Canny, profundidad, pose, MLSD o trayectorias. Admite resoluciones de 512, 768 y 1024 píxeles y fue entrenado con secuencias de 81 fotogramas a 16 FPS.
Como usar
Puede ejecutarse con VideoX-Fun mediante Docker, ComfyUI o scripts locales de Python. Para iniciar el entorno Docker y descargar el repositorio:
# Descargar la imagen
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun
# Iniciar el contenedor
docker run -it -p 7860:7860 --network host --gpus all --security-opt seccomp:unconfined --shm-size 200g mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun
# Clonar VideoX-Fun
git clone https://github.com/aigc-apps/VideoX-Fun.git
cd VideoX-Fun
# Crear los directorios para los pesos
mkdir models/Diffusion_Transformer
mkdir models/Personalized_Model
Después, descargue los pesos del modelo y colóquelos en models/Diffusion_Transformer/. Seleccione el script correspondiente dentro de examples/ y configure el prompt, el prompt negativo, la escala de guía, la semilla y las entradas de control. Para reducir el consumo de VRAM puede usar model_cpu_offload, model_cpu_offload_and_qfloat8 o sequential_cpu_offload; la cuantización float8 ahorra más memoria, aunque puede reducir la calidad. Se requieren aproximadamente 60 GB de espacio libre y una instalación compatible de CUDA.
Funcionalidades
- Generación de texto a vídeo y vídeo controlado
- Condicionamiento mediante Canny, profundidad, pose y MLSD
- Control de movimiento mediante trayectorias
- Generación guiada por una imagen o un sujeto de referencia
- Compatibilidad con resoluciones de 512, 768 y 1024 píxeles
- Secuencias de 81 fotogramas a 16 FPS
- Modos de ahorro de VRAM mediante descarga a CPU y cuantización float8
- Integración con VideoX-Fun, ComfyUI, interfaces Gradio y Docker
- Pesos de aproximadamente 64 GB
- Licencia Apache 2.0
Casos de uso
- Crear vídeos a partir de descripciones textuales
- Animar una imagen o un sujeto de referencia
- Generar vídeo siguiendo la pose o el movimiento de una grabación de control
- Aplicar estructura visual mediante mapas Canny, profundidad o líneas MLSD
- Dirigir movimientos mediante trayectorias definidas
- Producir variaciones controladas de un vídeo existente
- Crear secuencias de vídeo multilingües con control espacial y temporal