CoolFace
Modelpublic

RL-Forgetting-Experiments-3/qwen2.5-3b-math-sft-ordered-lr1e5-step1072

sourceHugging Faceupdated 2d agoView on Hugging Face
0likes196downloads
Model Card

math_ordered

Qwen2.5-3B one-epoch SFT checkpoint for the math ordered arm at optimizer step 1072. See delivery_manifest.json for exact source lineage and weight checksums.