Identity-as-Presence

echoanran
Texto a video

Modelo de generación conjunta de audio y vídeo personalizado por identidad. Conserva de forma coherente la apariencia facial y el timbre de voz en escenas con uno o varios sujetos. Se basa en Wan2.2-TI2V-5B y fue ajustado a partir de Ovi.

Como usar

Instalación y ejemplo con Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained(
    "echoanran/Identity-as-Presence",
    dtype=torch.bfloat16,
    device_map="cuda"
)

prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

También se ofrecen accesos de inicio mediante Google Colab y Kaggle. El modelo no está desplegado actualmente por ningún proveedor de inferencia.

Funcionalidades

Generación conjunta de audio y vídeo con conciencia de identidad
Personalización de alta fidelidad mediante apariencia facial y timbre de voz
Compatibilidad con escenas de uno o varios sujetos
Mecanismo escalable de inyección de identidad multimodal
21 mil millones de parámetros en formato Safetensors y precisión BF16
Implementación oficial del artículo «Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation»
Licencia Apache 2.0

Casos de uso

Crear vídeos personalizados que mantengan la apariencia y la voz de una persona
Generar interacciones audiovisuales coherentes entre varios sujetos identificables
Investigar métodos de personalización conjunta de rostro y timbre vocal
Producir contenido audiovisual sintético con continuidad de identidad entre modalidades