ReasoningRegisters/olmo32b
0
Olmo-3-32B GRPO (RL-Zero, MATH) LoRA checkpoints
Base: allenai/Olmo-3-1125-32B. GRPO 300 steps, LoRA r=64, truncation penalty. checkpoint-{50..300}: LoRA adapters (merge with peft mergeandunload for eval). MATH-500 pass@1: base 0.6747 -> ck300 0.9167. AIME24 0.3365->0.5385, AIME25 0.2604->0.4219.
