CoolFace
Datasetpublic

fassabilf/ift-eval-us-dpo-even

Eval Diffusion-DPO SD 1.5 — foto asli, UK, gender Gambar hasil generate dan label Gemini untuk arm DPO foto asli UK (fassabilf/sd15-dpo-uk-real, pasangan preferensi di folder dpo/ dataset fassabilf/ift-train-uk-real). Bukan arm SFT/IFT — itu ada di fassabilf/ift-eval-uk-real. 20 okupasi terlatih (sufiks _uk), 2.000 pasangan train / 600 val, 63 step/epoch, 20 epoch = 1.260 step. split checkpoint protokol n per okupasi test_ep* ep5, 10, 15, 20 pilot_sd15 apa adanya:… See the full description on the dataset page: https://huggingface.co/datasets/fassabilf/ift-eval-us-dpo-even.

sourceHugging Facecreativeml-openrail-mupdated 5d agoView on Hugging Face
0likes70downloads
Dataset Card

Eval Diffusion-DPO SD 1.5 — foto asli, UK, gender

Gambar hasil generate dan label Gemini untuk arm DPO foto asli UK (fassabilf/sd15-dpo-uk-real, pasangan preferensi di folder dpo/ dataset fassabilf/ift-train-uk-real). Bukan arm SFT/IFT — itu ada di fassabilf/ift-eval-uk-real.

20 okupasi terlatih (sufiks _uk), 2.000 pasangan train / 600 val, 63 step/epoch, 20 epoch = 1.260 step.

splitcheckpointprotokoln per okupasi
test_ep*ep5, 10, 15, 20pilot_sd15 apa adanya: varian framing, --seed-mode paired --seed-base 0, --max-attempts 3, batch 8100
val_ep*ep2..20 tiap 2 epochsama, tapi --max-attempts 1, batch 3230
heldout_ep*ep5, 20protokol test, 5 okupasi yang tidak dilatih: metalfitter, seniorcareworker, careworker, crossingpatrol, educationsupport100

512 px, 30 step, guidance 7,5, judge gemini-3.1-pro-preview. Baseline pembanding adalah SD 1.5 base UK per-gambar dengan seed dan prompt yang sama (analysis/ift/eval_uk_sd15_base.csv, MAE_real chosen 0,1716).

  • <split>_ep<N>/<okupasi>/predictions.csv — label per gambar, tanpa perlu unduh zip
  • <split>_ep<N>/<okupasi>/manifest.csv, gemini_judge_meta.json — setelan judge persis
  • zips/<split>_ep<N>__<okupasi>.zip — gambarnya
  • analysis/ — CSV bootstrap, paired Δ vs base, held-out per-okupasi, fixed-t val loss, dan mode_seeking_*.csv

Angka utama — paired ΔMAE_real vs base SD 1.5 UK, cluster bootstrap 95 % atas 20 okupasi (analysis/delta_vs_base_test.csv):

ckptΔMAE_real95 % CIΔUnclear95 % CI
ep5−0,0043[−0,0627, +0,0517]+0,0440[+0,0135, +0,0765]
ep10−0,0003[−0,0420, +0,0452]+0,0490[+0,0215, +0,0770]
ep15+0,0147[−0,0294, +0,0580]+0,0525[+0,0290, +0,0770]
ep20+0,0017[−0,0630, +0,0667]+0,0760[+0,0400, +0,1155]

Baca ini sebelum memakai checkpoint mana pun. Keempat CI ΔMAEreal memuat nol: arm DPO ini **tidak** memperbaiki bias gender pada tingkat yang bisa dibedakan dari noise sampling. MAEreal absolutnya 0,1716 (base) → 0,1672 / 0,1713 / 0,1863 / 0,1732. Sebagai pembanding, arm SFT UK pada protokol identik mencapai 0,1274 / 0,1443 / 0,1163 / 0,1141.

Yang justru signifikan adalah kerusakannya: unclear-rate naik monoton 0,0995 → 0,1755, dan keempat CI ΔUnclear tidak memuat nol. Model jadi lebih sering menghasilkan gambar yang gendernya tak bisa ditentukan, tanpa imbalan keseimbangan. Bobotnya dirilis sebagai catatan hasil negatif, bukan sebagai model yang disarankan dipakai.

Catatan plafon: akurasi implisit DPO dibatasi 0,6432 (dipaku dari data sebelum training, analysis/ceiling.csv). Akurasi implisit train plateau di 0,63–0,64 — tepat di bawah plafon; fixed-t val memuncak 0,654 di ep6 lalu turun, dan val loss naik monoton tanpa minimum. n=30 per okupasi di val → SD sampling MAE ≈ 0,02, jadi kurvanya bergerigi.


Status: upload sebagian. Sebagian epoch di bawah ini arm-nya belum lengkap saat commit ini dibuat; jangan pakai angkanya untuk membandingkan checkpoint.
splitepocharm terisi
valep214 (sebagian, dari 20)
valep414 (sebagian, dari 20)
valep614 (sebagian, dari 20)
valep1014 (sebagian, dari 20)
valep1414 (sebagian, dari 20)
valep1814 (sebagian, dari 20)
valep2014 (sebagian, dari 20)
testep514 (sebagian, dari 20)
testep1014 (sebagian, dari 20)
testep1514 (sebagian, dari 20)
testep2014 (sebagian, dari 20)