Cosmik-lora

visionmaster2
Texto a video

Adaptador LoRA de visionmaster2 basado en Wan2.2-T2V-A14B, entrenado con AI Toolkit de Ostris. Está orientado a generar contenido visual con la estética o concepto «CosmikR», que funciona como palabra de activación.

Como usar

Instala las dependencias y carga el LoRA sobre su modelo base para generar un vídeo:

pip install -U diffusers transformers accelerate

import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video

# Cambia a "mps" en dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "ai-toolkit/Wan2.2-T2V-A14B-Diffusers-bf16",
    torch_dtype=torch.bfloat16,
    device_map="cuda"
)
pipe.load_lora_weights("visionmaster2/Cosmik-lora")

prompt = "CosmikR"
output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")

La ficha también incluye este ejemplo para cargar directamente el archivo de pesos de bajo ruido:

from diffusers import AutoPipelineForText2Image
import torch

pipeline = AutoPipelineForText2Image.from_pretrained(
    'ai-toolkit/Wan2.2-T2V-A14B-Diffusers-bf16',
    torch_dtype=torch.bfloat16
).to('cuda')
pipeline.load_lora_weights(
    'visionmaster2/Cosmik-lora',
    weight_name='Cosmik_low_noise.safetensors'
)
image = pipeline('CosmikR').images[0]
image.save("my_image.png")

Debe incluirse CosmikR en el prompt para activar el concepto aprendido. El segundo ejemplo aparece tal cual en la ficha, aunque combina un modelo base de texto a vídeo con una canalización de texto a imagen, por lo que puede requerir ajustes según la versión de Diffusers y el flujo utilizado.

Funcionalidades

Adaptador LoRA para el modelo base ai-toolkit/Wan2.2-T2V-A14B-Diffusers-bf16.
Generación de texto a vídeo mediante Diffusers.
Palabra de activación: CosmikR.
Pesos disponibles en formato Safetensors.
Compatible, según la ficha, con ComfyUI, AUTOMATIC1111, SD.Next, Invoke AI y Diffusers.
Licencia CreativeML Open RAIL-M.

Casos de uso

Crear vídeos a partir de prompts que incorporen el concepto visual CosmikR.
Integrar el estilo aprendido por el LoRA en flujos de generación basados en Wan2.2.
Usar sus pesos Safetensors en interfaces locales compatibles para experimentar con generación visual.