POV-Driving

Remade-AI
Texto a video

LoRA de generación de vídeo entrenado sobre Wan2.1 14B T2V para crear secuencias de conducción en primera persona dentro de escenas y paisajes personalizables. Utiliza la frase activadora «p0v_dr1v1n6» y se distribuye en formato Safetensors bajo licencia Apache 2.0.

Como usar

Instala las dependencias y carga el LoRA sobre el modelo base Wan2.1 14B T2V. Incluye la frase activadora p0v_dr1v1n6 en la descripción de la escena.

pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video

# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
    "Wan-AI/Wan2.1-T2V-14B",
    dtype=torch.bfloat16,
    device_map="cuda"
)
pipe.load_lora_weights("Remade-AI/POV-Driving")

prompt = "p0v_dr1v1n6, video shows a person driving a car through a burning hellscape. The driver is holding the steering wheel with both hands. Rivers of lava flow on both sides of the cracked road, and firestorms rage in the distance."

output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")

Funcionalidades

Generación de vídeos de conducción desde la perspectiva del conductor.
Adaptador LoRA para el modelo base Wan2.1 14B T2V.
Resultados consistentes con distintos entornos, escenas y tipos de objetos.
Entrenado durante 5 épocas con 17 minutos de vídeo, distribuidos en 204 clips de conducción POV subtitulados individualmente.
Compatibilidad con Diffusers y con un flujo modificado de Wan Video Wrapper para ComfyUI.
Ajustes recomendados: intensidad LoRA 1.0, escala de guía integrada 6.0 y Flow Shift 5.0.

Casos de uso

Crear vídeos inmersivos de conducción en primera persona.
Situar el interior de un automóvil en escenarios fantásticos, urbanos, desérticos o extraterrestres.
Producir secuencias conceptuales para cine, videojuegos, publicidad o visualización creativa.
Generar variaciones de paisajes y condiciones ambientales manteniendo la perspectiva del conductor.