flavianv/qwen4b-reward-pairwise-v1
08
DeepShopper Reward V1 — pairwise Bradley-Terry outfit reward (Qwen3-4B)
Reward V1: a Qwen3-4B AutoModelForSequenceClassification (scalar value head) warm-started from [V0](https://huggingface.co/flavianv/qwen4b-apparel23-bundle-sft) and trained with margin Bradley-Terry loss on gold-vs-corrupted preference pairs — to discriminate good outfits, fixing V0's gender/structure blindness.
- Data: `flavianv/deepshopper-reward-pairs` — 93k train pairs, 5 corruption types (genderflip, itemswap, duplicaterole, countdrop, crossneed); larger margin for genderflip.
- Held-out ranking accuracy: overall 0.995, gender_flip 0.999 (V0 was flat on gender), duplicaterole 1.0, countdrop 0.998, crossneed 0.993, itemswap 0.987.
- Use: score an outfit (system bundle prompt + need +
### Item i: role\ntitle) → scalar reward (higher = better). - Note: "good" = resembling observed/sold bundles (purchase-likeness), the intended objective; still a learned proxy for real sales.
Code: https://github.com/clijo/reco-rl (branch outfit_bundle).
