CoolFace
Modelpublic

hkr04/distill-1.5b-grpo-minmax

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes4downloads
Model Card

Trained on DAPO-Math-17k using GRPO implemented by VeRL.

  • —Batch Size: 32
  • —Group Size: 8
  • —Step: 280
  • —Max Response Length: 8192