CoolFace
Modelpublic

RL-Forgetting-Experiments-3/qwen2.5-3b-kk-sft-ordered-lr1e5-step3175

sourceHugging Faceupdated 2d agoView on Hugging Face
0likes388downloads
Model Card

kk_ordered

Qwen2.5-3B one-epoch SFT checkpoint for the kk ordered arm at optimizer step 3175. Inference-complete, not resumable: all HF model files are present, but the later optimizer/prev-params serialization failed. Those broken training-state files are not included.

See delivery_manifest.json for exact source lineage and weight checksums.