CoolFace
Modelpublic

ReasoningRegisters/olmo32b

sourceHugging Faceupdated 13d agoView on Hugging Face
0likes
Model Card

Olmo-3-32B GRPO (RL-Zero, MATH) LoRA checkpoints

Base: allenai/Olmo-3-1125-32B. GRPO 300 steps, LoRA r=64, truncation penalty. checkpoint-{50..300}: LoRA adapters (merge with peft mergeandunload for eval). MATH-500 pass@1: base 0.6747 -> ck300 0.9167. AIME24 0.3365->0.5385, AIME25 0.2604->0.4219.