POV-Driving
Remade-AI
Texto a video
LoRA de generación de vídeo entrenado sobre Wan2.1 14B T2V para crear secuencias de conducción en primera persona dentro de escenas y paisajes personalizables. Utiliza la frase activadora «p0v_dr1v1n6» y se distribuye en formato Safetensors bajo licencia Apache 2.0.
Como usar
Instala las dependencias y carga el LoRA sobre el modelo base Wan2.1 14B T2V. Incluye la frase activadora p0v_dr1v1n6 en la descripción de la escena.
pip install -U diffusers transformers accelerate
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video
# Cambia a "mps" para dispositivos Apple
pipe = DiffusionPipeline.from_pretrained(
"Wan-AI/Wan2.1-T2V-14B",
dtype=torch.bfloat16,
device_map="cuda"
)
pipe.load_lora_weights("Remade-AI/POV-Driving")
prompt = "p0v_dr1v1n6, video shows a person driving a car through a burning hellscape. The driver is holding the steering wheel with both hands. Rivers of lava flow on both sides of the cracked road, and firestorms rage in the distance."
output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")
Funcionalidades
- Generación de vídeos de conducción desde la perspectiva del conductor.
- Adaptador LoRA para el modelo base Wan2.1 14B T2V.
- Resultados consistentes con distintos entornos, escenas y tipos de objetos.
- Entrenado durante 5 épocas con 17 minutos de vídeo, distribuidos en 204 clips de conducción POV subtitulados individualmente.
- Compatibilidad con Diffusers y con un flujo modificado de Wan Video Wrapper para ComfyUI.
- Ajustes recomendados: intensidad LoRA 1.0, escala de guía integrada 6.0 y Flow Shift 5.0.
Casos de uso
- Crear vídeos inmersivos de conducción en primera persona.
- Situar el interior de un automóvil en escenarios fantásticos, urbanos, desérticos o extraterrestres.
- Producir secuencias conceptuales para cine, videojuegos, publicidad o visualización creativa.
- Generar variaciones de paisajes y condiciones ambientales manteniendo la perspectiva del conductor.