arcan3_251003_wan22-t2v_v12-rank32-lora

synap5e
Texto a video

Adaptador LoRA de rango 32 para generación de vídeo a partir de texto, entrenado con AI Toolkit sobre el modelo base Wan2.2-T2V-A14B-Diffusers-bf16. Se distribuye en formato Safetensors y no requiere palabras de activación.

Como usar

Instala las dependencias y carga el LoRA sobre su modelo base:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video

# Cambia a "mps" para dispositivos Apple cuando corresponda.
pipe = DiffusionPipeline.from_pretrained(
    "ai-toolkit/Wan2.2-T2V-A14B-Diffusers-bf16",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)
pipe.load_lora_weights(
    "synap5e/arcan3_251003_wan22-t2v_v12-rank32-lora"
)

prompt = "A man with short gray hair plays a red electric guitar."
output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")

La página también muestra este ejemplo alternativo para cargar directamente el archivo de pesos de bajo ruido, aunque utiliza una canalización de texto a imagen:

from diffusers import AutoPipelineForText2Image
import torch

pipeline = AutoPipelineForText2Image.from_pretrained(
    'ai-toolkit/Wan2.2-T2V-A14B-Diffusers-bf16',
    torch_dtype=torch.bfloat16
).to('cuda')
pipeline.load_lora_weights(
    'synap5e/arcan3_251003_wan22-t2v_v12-rank32-lora',
    weight_name='arcan3_251003_wan22-t2v_v12-rank32_low_noise.safetensors'
)
image = pipeline('a beautiful landscape').images[0]
image.save("my_image.png")

Funcionalidades

Generación de vídeo condicionada por texto mediante el modelo base Wan2.2-T2V-A14B.
Adaptador LoRA de rango 32 entrenado con AI Toolkit de Ostris.
Pesos disponibles en formato Safetensors.
Compatible con la biblioteca Diffusers.
Descargable para flujos locales con herramientas como ComfyUI, AUTOMATIC1111, SD.Next e Invoke AI.
No tiene palabras de activación definidas.
No está desplegado actualmente en ningún proveedor de inferencia.

Casos de uso

Generar clips de vídeo a partir de descripciones textuales con Wan2.2-T2V.
Incorporar el estilo o ajuste aprendido por este LoRA en flujos locales de Diffusers.
Integrar los pesos Safetensors en flujos compatibles de ComfyUI u otras interfaces de generación.
Experimentar con generación audiovisual acelerada mediante GPU CUDA.