t2ance/mat-01-lr-versus-learning-signal
01 Learning rate versus the learning signal When the round-best score on a CPU-only Kaggle task stops rising during GRPO training, is the binding constraint the learning rate (too small to move the policy, or too large to keep it stable), or the learning signal itself (what the search samples and how the reward separates it)? This repository is the data root of that question: every training run's tree-search rollout archive it produced between 2026-06-29 and 2026-07-03, minus… See the full description on the dataset page: https://huggingface.co/datasets/t2ance/mat-01-lr-versus-learning-signal.
Publish 150 files of 01-lr-versus-learning-signal (350/350) (part 3)
Publish 150 files of 01-lr-versus-learning-signal (350/350) (part 2)
Publish 150 files of 01-lr-versus-learning-signal (350/350)
Publish 200 files of 01-lr-versus-learning-signal (200/350) (part 4)
Publish 200 files of 01-lr-versus-learning-signal (200/350) (part 3)
Publish 200 files of 01-lr-versus-learning-signal (200/350) (part 2)
Publish 200 files of 01-lr-versus-learning-signal (200/350)
initial commit
