airdude/tfg-diffusion-dpo-sdxl-r8
05
tfg-diffusion-dpo-sdxl-r8
Adaptador LoRA r=8 sobre el UNet de Stable Diffusion XL base 1.0, entrenado con Diffusion-DPO siguiendo la receta de Wallace et al. (2024) adaptada al pipeline diffusers.
Configuración
- Base:
stabilityai/stable-diffusion-xl-base-1.0(UNet) - LoRA: r=8, alpha=8, targetmodules=[toq, tok, tov, to_out.0]
- Dataset:
kashif/pickascore(500 pares filtrados) - Loss: log-sigmoide de Wallace 2024 con beta=2000
- Pasos: 210 sobre A100 80 GB (~33 min)
Resultado
Resultado nulo a esta escala (deltas MSE 10⁻⁵-10⁻⁴, CLIPSIM idéntico al base sobre los 20 prompts evaluados). El factor limitante es el tamaño del dataset, no la duración del entrenamiento: Wallace et al. emplean del orden de 800.000 pares y 24 días-GPU.
El experimento sirve como verificación de pipeline end-to-end del Diffusion-DPO sobre SDXL. Las consideraciones de escalado quedan en las líneas futuras.
