CoolFace
Apppublic

tomyimkc/repro-provable-benefits-of-rlvr-over-sft-for-reasoning-models-learning-to-backtrack-ef

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes
App README

Reproduction: Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently

An open experiment logbook, published with Trackio.