Wan2.1-Fun-V1.1-1.3B-InP

brucextt
Texto a video

Modelo de 1.300 millones de parámetros para generar vídeo a partir de texto o imágenes. Fue entrenado con múltiples resoluciones, admite una imagen inicial y otra final para condicionar la secuencia y ocupa aproximadamente 19 GB. Esta página es un duplicado del modelo original de Alibaba PAI.

Como usar

Puede utilizarse localmente mediante VideoX-Fun, ComfyUI o su interfaz web. La tarjeta recomienda descargar los pesos en models/Diffusion_Transformer/Wan2.1-Fun-V1.1-1.3B-InP/. Para equipos con VRAM limitada ofrece los modos model_cpu_offload, model_cpu_offload_and_qfloat8 y sequential_cpu_offload.

Inicio mediante Docker:

# Descargar la imagen
docker pull mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun

# Iniciar el contenedor
docker run -it -p 7860:7860 --network host --gpus all --security-opt seccomp:unconfined --shm-size 200g mybigpai-public-registry.cn-beijing.cr.aliyuncs.com/easycv/torch_cuda:cogvideox_fun

# Clonar VideoX-Fun
git clone https://github.com/aigc-apps/VideoX-Fun.git
cd VideoX-Fun

# Preparar los directorios para los pesos
mkdir models/Diffusion_Transformer
mkdir models/Personalized_Model

No se proporciona todavía un fragmento de inferencia específico para este modelo en la integración de VideoX-Fun de Hugging Face; es necesario consultar los archivos del repositorio y la documentación de la biblioteca.

Funcionalidades

Generación de texto a vídeo
Generación de imagen a vídeo
Condicionamiento mediante imágenes de inicio y fin
Entrenamiento multirresolución
Compatibilidad con VideoX-Fun y ComfyUI
Modos de ahorro de VRAM mediante descarga del modelo a CPU y cuantización float8
Pesos distribuidos en formato Safetensors
Licencia Apache 2.0

Casos de uso

Crear vídeos a partir de descripciones en lenguaje natural
Animar una imagen de referencia
Generar una transición de vídeo condicionada por una imagen inicial y otra final
Producir clips creativos multirresolución mediante VideoX-Fun
Integrar generación de vídeo en flujos visuales de ComfyUI