CoolFace
Apppublic

gchauhan/repro-grpo-rlvr

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes
App README

Reproduction: Reinforcement Learning with Verifiable Rewards — GRPO's Loss, Dynamics, and Success Amplification

An open experiment logbook, published with Trackio.