LTXV_13B_LoRA_triple_face_crops

naomiKenKorem
Texto a video

Adaptación LoRA de LTXV_13B_097_DEV para generación de vídeo a partir de texto e imagen. Fue ajustada con datos personalizados durante 80.000 pasos, con una tasa de aprendizaje de 0,0002 y un tamaño de lote de 1.

Como usar

El modelo está diseñado para utilizarse con el pipeline LTXV de Lightricks. La página también proporciona este ejemplo de carga mediante Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# Cambia a "mps" en dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "naomiKenKorem/LTXV_13B_LoRA_triple_face_crops",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

Para usar el LoRA entrenado en ComfyUI, copia el archivo de pesos .safetensors en la carpeta models/loras. Después, añade el nodo «LTXV LoRA Selector» para seleccionar el archivo y conéctalo a «LTXV LoRA Loader» para aplicarlo a la generación. Los flujos de referencia para texto a vídeo e imagen a vídeo están disponibles en el repositorio oficial de LTXV para ComfyUI.

Funcionalidades

Ajuste fino LoRA basado en LTXV_13B_097_DEV
Generación de texto a vídeo
Compatibilidad con flujos de imagen a vídeo de LTXV
Integración con ComfyUI mediante los nodos LTXV LoRA Selector y LTXV LoRA Loader
Entrenamiento realizado con LTX-Video-Trainer

Casos de uso

Crear vídeos a partir de descripciones textuales con el pipeline LTXV
Aplicar el LoRA en flujos de generación de vídeo de ComfyUI
Experimentar con escenas en las que aparecen personas, como un hombre emergiendo de una caja
Generar secuencias ambientales con personajes, como una mujer caminando por un bosque oscuro
Incorporar el ajuste LoRA en flujos de texto a vídeo o imagen a vídeo compatibles con LTXV