Remade-AI/Zoom-Call

Remade-AI
Texto a video

LoRA de generación de texto a vídeo entrenado sobre Wan2.1 14B T2V para crear vídeos que simulan videollamadas de Zoom con personajes, criaturas u objetos personalizados distribuidos en una cuadrícula de participantes.

Como usar

Instala las dependencias y carga el LoRA sobre Wan2.1 14B T2V. El prompt debe incluir la frase de activación [z00m_ca11] y describir la posición y la acción de cada participante.

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video

# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-14B",
    dtype=torch.bfloat16,
    device_map="cuda"
)
pipe.load_lora_weights("Remade-AI/Zoom-Call")

prompt = "The video shows a [z00m_ca11] with four participants. In the top left box, a medieval knight in full armor adjusts his helmet. To his right, a pirate with a parrot on his shoulder drinks from a mug. In the bottom left, a scientist in a lab coat scribbles on a whiteboard. In the bottom right, an alien in a suit waves awkwardly."

output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")

Ajustes recomendados para ComfyUI: intensidad del LoRA 1.0, escala de guía integrada 6.0 y Flow Shift 5.0.

Funcionalidades

Adaptador LoRA para el modelo base Wan-AI/Wan2.1-T2V-14B.
Genera composiciones de videollamada con varios participantes.
Ofrece resultados consistentes con distintos tipos de personajes y objetos.
Utiliza la frase de activación `[z00m_ca11]`.
Pesos disponibles en formato Safetensors.
Compatible con Diffusers y con un flujo modificado de Wan Video Wrapper para ComfyUI.
Entrenado durante 10 épocas con 28 clips cortos, equivalentes a dos minutos de grabaciones de videollamadas.
Licencia Apache 2.0.

Casos de uso

Crear vídeos humorísticos o surrealistas con formato de videollamada.
Representar conversaciones virtuales entre personajes ficticios, animales o criaturas.
Producir escenas de reuniones remotas para contenido social y entretenimiento.
Generar composiciones de tres o cuatro participantes con acciones diferenciadas.
Prototipar secuencias de videollamada mediante Diffusers o ComfyUI.