reasoning-registers
arm1-eval-rollouts
arm1 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm1.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
qwen14b-math500-eval-rollouts
Qwen3-14B GRPO — MATH-500 eval rollout shards
Raw evaluation rollouts behind the MATH-500 curves in the two Qwen3-14B GRPO runs
(vanilla qwen14b-MATH and the cue-forced qwen14b-MATH-cue branch of
avdravid/reasoning_registers_grpo). Checkpoints: model repos
ReasoningRegisters/qwen14b and
ReasoningRegisters/qwen14b_cue.
Layout
Two runs, one folder per curve point, 8 shards each (the eval ran 8-way sharded over MATH-500):
vanilla/step{0,50,...,300}/ — Qwen3-14B-Base… See the full description on the dataset page: https://huggingface.co/datasets/ReasoningRegisters/qwen14b-math500-eval-rollouts.arm3-eval-rollouts
arm3 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm3.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
base-eval-rollouts
base eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/base (untrained base model).
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
arm2-eval-rollouts
arm2 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm2.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
arm4-eval-rollouts
arm4 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm4.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
