fassabilf/ift-eval-us-dpo-even
Eval Diffusion-DPO SD 1.5 — foto asli, UK, gender Gambar hasil generate dan label Gemini untuk arm DPO foto asli UK (fassabilf/sd15-dpo-uk-real, pasangan preferensi di folder dpo/ dataset fassabilf/ift-train-uk-real). Bukan arm SFT/IFT — itu ada di fassabilf/ift-eval-uk-real. 20 okupasi terlatih (sufiks _uk), 2.000 pasangan train / 600 val, 63 step/epoch, 20 epoch = 1.260 step. split checkpoint protokol n per okupasi test_ep* ep5, 10, 15, 20 pilot_sd15 apa adanya:… See the full description on the dataset page: https://huggingface.co/datasets/fassabilf/ift-eval-us-dpo-even.
Eval Diffusion-DPO SD 1.5 — foto asli, UK, gender
Gambar hasil generate dan label Gemini untuk arm DPO foto asli UK (fassabilf/sd15-dpo-uk-real, pasangan preferensi di folder dpo/ dataset fassabilf/ift-train-uk-real). Bukan arm SFT/IFT — itu ada di fassabilf/ift-eval-uk-real.
20 okupasi terlatih (sufiks _uk), 2.000 pasangan train / 600 val, 63 step/epoch, 20 epoch = 1.260 step.
512 px, 30 step, guidance 7,5, judge gemini-3.1-pro-preview. Baseline pembanding adalah SD 1.5 base UK per-gambar dengan seed dan prompt yang sama (analysis/ift/eval_uk_sd15_base.csv, MAE_real chosen 0,1716).
<split>_ep<N>/<okupasi>/predictions.csv— label per gambar, tanpa perlu unduh zip<split>_ep<N>/<okupasi>/manifest.csv,gemini_judge_meta.json— setelan judge persiszips/<split>_ep<N>__<okupasi>.zip— gambarnyaanalysis/— CSV bootstrap, paired Δ vs base, held-out per-okupasi, fixed-t val loss, danmode_seeking_*.csv
Angka utama — paired ΔMAE_real vs base SD 1.5 UK, cluster bootstrap 95 % atas 20 okupasi (analysis/delta_vs_base_test.csv):
Baca ini sebelum memakai checkpoint mana pun. Keempat CI ΔMAEreal memuat nol: arm DPO ini **tidak** memperbaiki bias gender pada tingkat yang bisa dibedakan dari noise sampling. MAEreal absolutnya 0,1716 (base) → 0,1672 / 0,1713 / 0,1863 / 0,1732. Sebagai pembanding, arm SFT UK pada protokol identik mencapai 0,1274 / 0,1443 / 0,1163 / 0,1141.
Yang justru signifikan adalah kerusakannya: unclear-rate naik monoton 0,0995 → 0,1755, dan keempat CI ΔUnclear tidak memuat nol. Model jadi lebih sering menghasilkan gambar yang gendernya tak bisa ditentukan, tanpa imbalan keseimbangan. Bobotnya dirilis sebagai catatan hasil negatif, bukan sebagai model yang disarankan dipakai.
Catatan plafon: akurasi implisit DPO dibatasi 0,6432 (dipaku dari data sebelum training, analysis/ceiling.csv). Akurasi implisit train plateau di 0,63–0,64 — tepat di bawah plafon; fixed-t val memuncak 0,654 di ep6 lalu turun, dan val loss naik monoton tanpa minimum. n=30 per okupasi di val → SD sampling MAE ≈ 0,02, jadi kurvanya bergerigi.
Status: upload sebagian. Sebagian epoch di bawah ini arm-nya belum lengkap saat commit ini dibuat; jangan pakai angkanya untuk membandingkan checkpoint.
