pratinavseth/cricket-captain-warmup-stage2
05
upgrade: 4B Qwen3-4B-Instruct-2507 main-run checkpoint-80 (LoRA r=64; 80 GRPO steps on 5-over)
fix: remove transformers-5.x-only fields (extra_special_tokens, response_schema) for HF Inference compat
warmup-v7: Qwen3-4B-Instruct-2507 base + XML prompt + reward unclip + neg-reward on loss (30 steps, 2-3 over curriculum)
Upload warmup (stage2) LoRA adapter — 25 GRPO steps, 5-over curriculum
initial commit
