LTXV_13B_LoRA_triple_face_crops
naomiKenKorem
Texto a video
Adaptación LoRA de LTXV_13B_097_DEV para generación de vídeo a partir de texto e imagen. Fue ajustada con datos personalizados durante 80.000 pasos, con una tasa de aprendizaje de 0,0002 y un tamaño de lote de 1.
Como usar
El modelo está diseñado para utilizarse con el pipeline LTXV de Lightricks. La página también proporciona este ejemplo de carga mediante Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# Cambia a "mps" en dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"naomiKenKorem/LTXV_13B_LoRA_triple_face_crops",
torch_dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
Para usar el LoRA entrenado en ComfyUI, copia el archivo de pesos .safetensors en la carpeta models/loras. Después, añade el nodo «LTXV LoRA Selector» para seleccionar el archivo y conéctalo a «LTXV LoRA Loader» para aplicarlo a la generación. Los flujos de referencia para texto a vídeo e imagen a vídeo están disponibles en el repositorio oficial de LTXV para ComfyUI.
Funcionalidades
- Ajuste fino LoRA basado en LTXV_13B_097_DEV
- Generación de texto a vídeo
- Compatibilidad con flujos de imagen a vídeo de LTXV
- Integración con ComfyUI mediante los nodos LTXV LoRA Selector y LTXV LoRA Loader
- Entrenamiento realizado con LTX-Video-Trainer
Casos de uso
- Crear vídeos a partir de descripciones textuales con el pipeline LTXV
- Aplicar el LoRA en flujos de generación de vídeo de ComfyUI
- Experimentar con escenas en las que aparecen personas, como un hombre emergiendo de una caja
- Generar secuencias ambientales con personajes, como una mujer caminando por un bosque oscuro
- Incorporar el ajuste LoRA en flujos de texto a vídeo o imagen a vídeo compatibles con LTXV