CoolFace
Apppublic

ai-sherpa/rlvr-sft-backtracking-separation-repro

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes
App README

Reproduction: Provable Benefits of RLVR over SFT for Reasoning Models — Learning to Backtrack Efficiently

An open experiment logbook, published with Trackio.