Wan2.1_VAE

wanabmeya
Texto a video

VAE causal 3D espacio-temporal de Wan2.1, diseñado para codificar y decodificar vídeos de hasta 1080p de longitud ilimitada conservando la información temporal histórica. Sirve como componente eficiente para generación de vídeo e imagen dentro de la familia Wan2.1.

Como usar

Instalación y uso básico con Diffusers:

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline

# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "wanabmeya/Wan2.1_VAE",
    dtype=torch.bfloat16,
    device_map="cuda"
)
prompt = "Astronaut in a jungle, cold color palette, muted colors, detailed, 8k"
image = pipe(prompt).images[0]

El repositorio completo de Wan2.1 también permite descargar los modelos T2V y ejecutar generación de vídeo con generate.py, incluyendo inferencia en una o varias GPU y extensión de prompts mediante Qwen o DashScope.

Funcionalidades

Compresión espacio-temporal optimizada para reducir el uso de memoria
Codificación y decodificación de vídeos 1080p de cualquier duración sin pérdida de información temporal
Arquitectura VAE causal 3D adaptada a generación de vídeo
Distribuido en formato Safetensors con licencia Apache 2.0
Integrable con Diffusers y los modelos de generación Wan2.1

Casos de uso

Componente de codificación y decodificación para generación de vídeo con Wan2.1
Preprocesamiento y reconstrucción de vídeos 1080p largos manteniendo la coherencia temporal
Generación de imágenes y vídeos mediante pipelines compatibles con Diffusers
Integración en flujos de edición de vídeo, image-to-video y text-to-video basados en Wan