ai-sherpa/rlvr-sft-backtracking-separation-repro
0
Reproduction: Provable Benefits of RLVR over SFT for Reasoning Models — Learning to Backtrack Efficiently
An open experiment logbook, published with Trackio.
An open experiment logbook, published with Trackio.