CoolFace
Modelpublic

airdude/tfg-diffusion-dpo-sdxl-r8

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes5downloads
Model Card

tfg-diffusion-dpo-sdxl-r8

Adaptador LoRA r=8 sobre el UNet de Stable Diffusion XL base 1.0, entrenado con Diffusion-DPO siguiendo la receta de Wallace et al. (2024) adaptada al pipeline diffusers.

Configuración

  • Base: stabilityai/stable-diffusion-xl-base-1.0 (UNet)
  • LoRA: r=8, alpha=8, targetmodules=[toq, tok, tov, to_out.0]
  • Dataset: kashif/pickascore (500 pares filtrados)
  • Loss: log-sigmoide de Wallace 2024 con beta=2000
  • Pasos: 210 sobre A100 80 GB (~33 min)

Resultado

Resultado nulo a esta escala (deltas MSE 10⁻⁵-10⁻⁴, CLIPSIM idéntico al base sobre los 20 prompts evaluados). El factor limitante es el tamaño del dataset, no la duración del entrenamiento: Wallace et al. emplean del orden de 800.000 pares y 24 días-GPU.

El experimento sirve como verificación de pipeline end-to-end del Diffusion-DPO sobre SDXL. Las consideraciones de escalado quedan en las líneas futuras.