ARACHNE-X-ULTRA-VIDEO

MagistrTheOne
Texto a video

Modelo fundacional abierto de generación de vídeo con 13.600 millones de parámetros. Unifica la generación de texto a vídeo, imagen a vídeo y continuación de vídeo, con especial atención a vídeos largos de alta calidad, resolución 720p y 30 fps. Emplea generación progresiva de grueso a fino, atención dispersa por bloques y ajuste RLHF multirrecompensa mediante GRPO. Los pesos se distribuyen bajo licencia MIT.

Como usar

Instalación:

git clone https://github.com/nullxes/ARACHNE-X-ULTRA
cd ARACHNE-X-ULTRA
conda create -n arachne python=3.10
conda activate arachne
pip install torch==2.6.0+cu124 torchvision==0.21.0+cu124 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124
pip install ninja psutil packaging flash_attn==2.7.4.post1
pip install -r requirements.txt

Descarga de los pesos:

pip install "huggingface_hub[cli]"
huggingface-cli download nullxes/ARACHNE-X-ULTRA --local-dir ./weights/ARACHNE-X-ULTRA

Generación de texto a vídeo con una GPU:

torchrun run_demo_text_to_video.py --checkpoint_dir=./weights/ARACHNE-X-ULTRA --enable_compile

Generación de texto a vídeo con varias GPU:

torchrun --nproc_per_node=2 run_demo_text_to_video.py --context_parallel_size=2 --checkpoint_dir=./weights/ARACHNE-X-ULTRA --enable_compile

Imagen a vídeo, continuación y generación larga:

torchrun run_demo_image_to_video.py --checkpoint_dir=./weights/ARACHNE-X-ULTRA --enable_compile
torchrun run_demo_video_continuation.py --checkpoint_dir=./weights/ARACHNE-X-ULTRA --enable_compile
torchrun run_demo_long_video.py --checkpoint_dir=./weights/ARACHNE-X-ULTRA --enable_compile

Generación interactiva e interfaz web:

torchrun run_demo_interactive_video.py --checkpoint_dir=./weights/ARACHNE-X-ULTRA --enable_compile
streamlit run ./run_streamlit.py --server.fileWatcherType none --server.headless=false

Funcionalidades

Arquitectura unificada para texto a vídeo, imagen a vídeo y continuación de vídeo.
Generación de vídeos de varios minutos con menor deriva de color y degradación de calidad.
Salida de vídeo a 720p y 30 fps en cuestión de minutos.
Estrategia de generación de grueso a fino en los ejes temporal y espacial.
Atención dispersa por bloques para mejorar la eficiencia a resoluciones altas.
Ajuste mediante RLHF multirrecompensa con Group Relative Policy Optimization (GRPO).
Compatibilidad con ejecución en una o varias GPU.
Interfaz de demostración disponible mediante Streamlit.

Casos de uso

Crear vídeos a partir de descripciones textuales.
Animar imágenes estáticas para convertirlas en secuencias de vídeo.
Extender vídeos existentes manteniendo la continuidad visual y temporal.
Generar vídeos largos de varios minutos.
Crear experiencias de generación de vídeo interactiva.
Prototipar herramientas audiovisuales mediante una interfaz Streamlit.