Wan2.1-Fun-V1.1-1.3B-InP
Modelo de 1.300 millones de parámetros para generar vídeo a partir de texto o imágenes. Fue entrenado con múltiples resoluciones, admite una imagen inicial y otra final para condicionar la secuencia y ocupa aproximadamente 19 GB. Esta página es un duplicado del modelo original de Alibaba PAI.
Como usar
Puede utilizarse localmente mediante VideoX-Fun, ComfyUI o su interfaz web. La tarjeta recomienda descargar los pesos en models/Diffusion_Transformer/Wan2.1-Fun-V1.1-1.3B-InP/. Para equipos con VRAM limitada ofrece los modos model_cpu_offload, model_cpu_offload_and_qfloat8 y sequential_cpu_offload.
Inicio mediante Docker:
# Descargar la imagen
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun
# Iniciar el contenedor
docker run -it -p 7860:7860 --network host --gpus all --security-opt seccomp:unconfined --shm-size 200g mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun
# Clonar VideoX-Fun
git clone https://github.com/aigc-apps/VideoX-Fun.git
cd VideoX-Fun
# Preparar los directorios para los pesos
mkdir models/Diffusion_Transformer
mkdir models/Personalized_Model
No se proporciona todavía un fragmento de inferencia específico para este modelo en la integración de VideoX-Fun de Hugging Face; es necesario consultar los archivos del repositorio y la documentación de la biblioteca.
Funcionalidades
- Generación de texto a vídeo
- Generación de imagen a vídeo
- Condicionamiento mediante imágenes de inicio y fin
- Entrenamiento multirresolución
- Compatibilidad con VideoX-Fun y ComfyUI
- Modos de ahorro de VRAM mediante descarga del modelo a CPU y cuantización float8
- Pesos distribuidos en formato Safetensors
- Licencia Apache 2.0
Casos de uso
- Crear vídeos a partir de descripciones en lenguaje natural
- Animar una imagen de referencia
- Generar una transición de vídeo condicionada por una imagen inicial y otra final
- Producir clips creativos multirresolución mediante VideoX-Fun
- Integrar generación de vídeo en flujos visuales de ComfyUI