CoolFace
Modelpublic

pratinavseth/cricket-captain-warmup-stage2

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes5downloads
5 commits on main
5d61e0f5mo ago

upgrade: 4B Qwen3-4B-Instruct-2507 main-run checkpoint-80 (LoRA r=64; 80 GRPO steps on 5-over)

pratinavseth
cd4a7af5mo ago

fix: remove transformers-5.x-only fields (extra_special_tokens, response_schema) for HF Inference compat

pratinavseth
7507ed95mo ago

warmup-v7: Qwen3-4B-Instruct-2507 base + XML prompt + reward unclip + neg-reward on loss (30 steps, 2-3 over curriculum)

pratinavseth
dbb31e65mo ago

Upload warmup (stage2) LoRA adapter — 25 GRPO steps, 5-over curriculum

pratinavseth
104d52d5mo ago

initial commit

pratinavseth