Winnskyy/AnimateDiff-Lightning

Winnskyy
Texto a video

Modelo ultrarrápido de generación de vídeo a partir de texto, destilado de AnimateDiff SD 1.5 v2 mediante destilación de difusión entre modelos. Genera vídeos más de diez veces más rápido que AnimateDiff original y ofrece variantes de 1, 2, 4 y 8 pasos.

Como usar

Instalación:

pip install -U diffusers transformers accelerate

Uso recomendado con Diffusers:

import torch
from diffusers import AnimateDiffPipeline, MotionAdapter, EulerDiscreteScheduler
from diffusers.utils import export_to_gif
from huggingface_hub import hf_hub_download
from safetensors.torch import load_file

device = "cuda"
dtype = torch.float16
step = 4  # Opciones: [1, 2, 4, 8]
repo = "ByteDance/AnimateDiff-Lightning"
ckpt = f"animatediff_lightning_{step}step_diffusers.safetensors"
base = "emilianJR/epiCRealism"

adapter = MotionAdapter().to(device, dtype)
adapter.load_state_dict(
    load_file(hf_hub_download(repo, ckpt), device=device)
)

pipe = AnimateDiffPipeline.from_pretrained(
    base,
    motion_adapter=adapter,
    torch_dtype=dtype
).to(device)

pipe.scheduler = EulerDiscreteScheduler.from_config(
    pipe.scheduler.config,
    timestep_spacing="trailing",
    beta_schedule="linear"
)

output = pipe(
    prompt="A girl smiling",
    guidance_scale=1.0,
    num_inference_steps=step
)

export_to_gif(output.frames[0], "animation.gif")

Para ComfyUI, hay que importar el flujo de AnimateDiff-Lightning, instalar AnimateDiff-Evolved y VideoHelperSuite, colocar el modelo base en /models/checkpoints/ y el checkpoint Lightning en /custom_nodes/ComfyUI-AnimateDiff-Evolved/models/. Para vídeo a vídeo también se requieren Advanced-ControlNet, comfyui_controlnet_aux y el checkpoint OpenPose en /models/controlnet/.

Funcionalidades

Generación de vídeo a partir de indicaciones de texto.
Variantes destiladas de 1, 2, 4 y 8 pasos; la variante de 1 paso está destinada principalmente a investigación.
Compatibilidad con modelos base estilizados de Stable Diffusion 1.5.
Integración con Diffusers y ComfyUI.
Admite generación de vídeo a vídeo mediante ControlNet y OpenPose.
Compatible con Motion LoRA para producir movimientos más intensos.
Licencia CreativeML Open RAIL-M.

Casos de uso

Crear animaciones y clips breves a partir de descripciones textuales.
Prototipar vídeos generativos rápidamente con pocos pasos de inferencia.
Animar escenas realistas, de anime, dibujos animados o estilo 3D usando distintos modelos base.
Transformar vídeos existentes conservando su movimiento o pose mediante ControlNet y OpenPose.
Investigar técnicas de destilación acelerada para modelos de difusión de vídeo.