Identity-as-Presence
echoanran
Texto a video
Modelo de generación conjunta de audio y vídeo personalizado por identidad. Conserva de forma coherente la apariencia facial y el timbre de voz en escenas con uno o varios sujetos. Se basa en Wan2.2-TI2V-5B y fue ajustado a partir de Ovi.
Como usar
Instalación y ejemplo con Diffusers:
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
# switch to "mps" for apple devices
pipe = DiffusionPipeline.from_pretrained(
"echoanran/Identity-as-Presence",
dtype=torch.bfloat16,
device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]
También se ofrecen accesos de inicio mediante Google Colab y Kaggle. El modelo no está desplegado actualmente por ningún proveedor de inferencia.
Funcionalidades
- Generación conjunta de audio y vídeo con conciencia de identidad
- Personalización de alta fidelidad mediante apariencia facial y timbre de voz
- Compatibilidad con escenas de uno o varios sujetos
- Mecanismo escalable de inyección de identidad multimodal
- 21 mil millones de parámetros en formato Safetensors y precisión BF16
- Implementación oficial del artículo «Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation»
- Licencia Apache 2.0
Casos de uso
- Crear vídeos personalizados que mantengan la apariencia y la voz de una persona
- Generar interacciones audiovisuales coherentes entre varios sujetos identificables
- Investigar métodos de personalización conjunta de rostro y timbre vocal
- Producir contenido audiovisual sintético con continuidad de identidad entre modalidades