LAMP-Qwen-2.5-VL
burakkizil
Texto a video
Planificador de movimiento basado en Qwen2.5-VL-7B-Instruct y ajustado para LAMP. Convierte instrucciones en lenguaje natural sobre el comportamiento de objetos y cámaras en programas de movimiento estructurados, que se transforman de forma determinista en trayectorias 3D para condicionar la generación de vídeo cinematográfico con VACE.
Como usar
Instala el repositorio y sus dependencias:
git clone https://github.com/mbkizil/LAMP.git && cd LAMP
pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
pip install wan@git+https://github.com/Wan-Video/Wan2.1
Descarga los pesos de VACE y del modelo LAMP ajustado:
chmod +x download.sh
./download.sh
Inicia la demostración interactiva de Gradio:
python -m src.serve.app --model-path ./qwen_checkpoints/LAMP-Qwen-2.5-VL
El comando carga el planificador de movimiento, inicializa la canalización VACE y abre un servidor local en http://127.0.0.1:8890. El proyecto fue probado con Python 3.11.13, CUDA 12.8 y PyTorch 2.8.0 o posterior.
Funcionalidades
- Planificación de movimientos de objetos y cámaras a partir de lenguaje natural
- Lenguaje específico de dominio inspirado en convenciones cinematográficas
- Síntesis de programas de movimiento estructurados mediante un modelo multimodal Qwen2.5-VL
- Conversión determinista de programas de movimiento en trayectorias 3D
- Integración con VACE para generar vídeos condicionados por trayectorias
- Modelo de aproximadamente 8.290 millones de parámetros en precisión F16
- Pesos distribuidos en formato Safetensors
- Ajuste fino de Qwen/Qwen2.5-VL-7B-Instruct
Casos de uso
- Diseño de movimientos de cámara cinematográficos mediante instrucciones textuales
- Generación de trayectorias 3D controlables para objetos y cámaras
- Planificación de escenas para generación de vídeo condicionada por movimiento
- Creación de planos con movimientos coordinados entre cámara y sujetos
- Experimentación académica con síntesis de programas aplicada al control de vídeo