CoolFace
Modelpublic

RL-Forgetting-Experiments-3/qwen2.5-3b-math-sft-shuffled-lr1e5-step1072

sourceHugging Faceupdated 1d agoView on Hugging Face
0likes195downloads
Model Card

math_shuffled

Qwen2.5-3B one-epoch SFT checkpoint for the math shuffled arm at optimizer step 1072. See delivery_manifest.json for exact source lineage and weight checksums.