amanuelcm/Wan2.1-T2V-1.3B-OldIllustration
amanuelcm
Texto a video
Adaptador LoRA para el modelo de texto a vídeo Wan-AI/Wan2.1-T2V-1.3B. Fue entrenado con un subconjunto de amanuelcm/OldIllustration-dataset para generar vídeos con apariencia de ilustración antigua, grabado lineal, sombreado de trama cruzada y textura de papel envejecido.
Como usar
Con Diffusers, carga el modelo base Wan2.1-T2V-1.3B-Diffusers, aplica los pesos LoRA y genera un vídeo MP4. Ejemplo completo:
pip install diffusers
import torch
from diffusers.utils import export_to_video
from diffusers import AutoencoderKLWan, WanPipeline
from diffusers.schedulers.scheduling_unipc_multistep import UniPCMultistepScheduler
model_id = "Wan-AI/Wan2.1-T2V-1.3B-Diffusers"
vae = AutoencoderKLWan.from_pretrained(model_id, subfolder="vae", torch_dtype=torch.float32)
pipe = WanPipeline.from_pretrained(model_id, vae=vae, torch_dtype=torch.bfloat16)
pipe.scheduler = UniPCMultistepScheduler.from_config(pipe.scheduler.config, flow_shift=5.0)
pipe.to("cuda")
pipe.load_lora_weights("amanuelcm/Wan2.1-T2V-1.3B-OldIllustration")
pipe.enable_model_cpu_offload() # para entornos con poca VRAM
prompt = "An old illustration of a mysterious clockmaker's workshop, filled with tiny gears, antique tools, and intricate machinery, drawn in the style of 19th-century engravings, extremely detailed linework, cross-hatching, high contrast ink, vintage texture, aged paper background, meticulous craftsmanship, historical accuracy, black and white etching style"
negative_prompt = "色调艳丽,过曝,静态,细节模糊不清,字幕,风格,作品,画作,画面,静止,整体发灰,最差质量,低质量,JPEG压缩残留,丑陋的,残缺的,多余的手指,多余的手部,画得不好的脸部,畸形的,毁容的,形态畸形的肢体,手指融合,静止不动的画面,杂乱的背景,三条腿,背景人很多,倒着走"
output = pipe(prompt=prompt, negative_prompt=negative_prompt, height=480, width=640, num_frames=49, guidance_scale=5.0, num_inference_steps=32).frames[0]
export_to_video(output, "output.mp4", fps=16)
También se puede usar la tubería simplificada de DiffusionPipeline:
from diffusers import DiffusionPipeline
from diffusers.utils import export_to_video
import torch
pipe = DiffusionPipeline.from_pretrained("Wan-AI/Wan2.1-T2V-1.3B", dtype=torch.bfloat16, device_map="cuda")
pipe.load_lora_weights("amanuelcm/Wan2.1-T2V-1.3B-OldIllustration")
prompt = "An old illustration of a waves continually crashing on a rocky shore, clouds pass overhead"
output = pipe(prompt=prompt).frames[0]
export_to_video(output, "output.mp4")
Para ComfyUI, usa el comfy.json proporcionado y descarga los componentes recomendados:
wget https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors
wget https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/vae/wan_2.1_vae.safetensors
wget https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/diffusion_models/wan2.1_t2v_1.3B_fp16.safetensors
Funcionalidades
- Generación de vídeo a partir de texto mediante Wan2.1-T2V-1.3B
- Estética de ilustración antigua, grabado en blanco y negro y textura de papel vintage
- Activación recomendada con la frase «An old illustration of»
- Compatible con Diffusers y ComfyUI
- Pesos distribuidos en formato Safetensors
- Licencia MIT
Casos de uso
- Crear clips de vídeo con estética de grabado histórico o ilustración de libro antiguo
- Visualizar escenas industriales, marítimas, mitológicas o históricas con apariencia vintage
- Prototipar animaciones estilizadas a partir de prompts narrativos
- Integrar generación de vídeo con temática de ilustración antigua en flujos de Diffusers o ComfyUI