amanuelcm/Wan2.1-T2V-1.3B-OldIllustration

amanuelcm
Texto a video

Adaptador LoRA para el modelo de texto a vídeo Wan-AI/Wan2.1-T2V-1.3B. Fue entrenado con un subconjunto de amanuelcm/OldIllustration-dataset para generar vídeos con apariencia de ilustración antigua, grabado lineal, sombreado de trama cruzada y textura de papel envejecido.

Como usar

Con Diffusers, carga el modelo base Wan2.1-T2V-1.3B-Diffusers, aplica los pesos LoRA y genera un vídeo MP4. Ejemplo completo:

pip install diffusers
import torch
from diffusers.utils import export_to_video
from diffusers import AutoencoderKLWan, WanPipeline
from diffusers.schedulers.scheduling_unipc_multistep import UniPCMultistepScheduler

model_id = "Wan-AI/Wan2.1-T2V-1.3B-Diffusers"
vae = AutoencoderKLWan.from_pretrained(model_id, subfolder="vae", torch_dtype=torch.float32)
pipe = WanPipeline.from_pretrained(model_id, vae=vae, torch_dtype=torch.bfloat16)
pipe.scheduler = UniPCMultistepScheduler.from_config(pipe.scheduler.config, flow_shift=5.0)
pipe.to("cuda")
pipe.load_lora_weights("amanuelcm/Wan2.1-T2V-1.3B-OldIllustration")
pipe.enable_model_cpu_offload()  # para entornos con poca VRAM

prompt = "An old illustration of a mysterious clockmaker's workshop, filled with tiny gears, antique tools, and intricate machinery, drawn in the style of 19th-century engravings, extremely detailed linework, cross-hatching, high contrast ink, vintage texture, aged paper background, meticulous craftsmanship, historical accuracy, black and white etching style"
negative_prompt = "色调艳丽,过曝,静态,细节模糊不清,字幕,风格,作品,画作,画面,静止,整体发灰,最差质量,低质量,JPEG压缩残留,丑陋的,残缺的,多余的手指,多余的手部,画得不好的脸部,畸形的,毁容的,形态畸形的肢体,手指融合,静止不动的画面,杂乱的背景,三条腿,背景人很多,倒着走"

output = pipe(prompt=prompt, negative_prompt=negative_prompt, height=480, width=640, num_frames=49, guidance_scale=5.0, num_inference_steps=32).frames[0]
export_to_video(output, "output.mp4", fps=16)

También se puede usar la tubería simplificada de DiffusionPipeline:

from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video
import torch

pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-T2V-1.3B", dtype=torch.bfloat16, device_map="cuda")
pipe.load_lora_weights("amanuelcm/Wan2.1-T2V-1.3B-OldIllustration")
prompt = "An old illustration of a waves continually crashing on a rocky shore, clouds pass overhead"
output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")

Para ComfyUI, usa el comfy.json proporcionado y descarga los componentes recomendados:

wget https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/vae/wan_2.1_vae.safetensors
wget https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/diffusion_models/wan2.1_t2v_1.3B_fp16.safetensors

Funcionalidades

Generación de vídeo a partir de texto mediante Wan2.1-T2V-1.3B
Estética de ilustración antigua, grabado en blanco y negro y textura de papel vintage
Activación recomendada con la frase «An old illustration of»
Compatible con Diffusers y ComfyUI
Pesos distribuidos en formato Safetensors
Licencia MIT

Casos de uso

Crear clips de vídeo con estética de grabado histórico o ilustración de libro antiguo
Visualizar escenas industriales, marítimas, mitológicas o históricas con apariencia vintage
Prototipar animaciones estilizadas a partir de prompts narrativos
Integrar generación de vídeo con temática de ilustración antigua en flujos de Diffusers o ComfyUI