datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
arm1-eval-rollouts
arm1 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm1.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
arm3-eval-rollouts
arm3 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm3.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
base-eval-rollouts
base eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/base (untrained base model).
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
arm2-eval-rollouts
arm2 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm2.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
arm4-eval-rollouts
arm4 eval rollouts
Eval rollouts (32 samples/problem) for ReasoningRegisters/arm4.
Split folders named step{k}_{benchmark}[_variant]; JSONL per shard: prompt, generation, correctness.
