CoolFace
Datasetpublic

MauroPello/reasoning-gym-verl-datasets

reasoning-gym-verl-datasets This dataset contains procedurally generated reasoning tasks from the Reasoning Gym (r-gym) framework, structured and pre-processed in parquet format for training models with veRL. These datasets were used to train MauroPello/Qwen3-1.7B-RL-final using GRPO (Group Relative Policy Optimization). Dataset Splits & Structure Split Name Path Size (Examples) Description train train.parquet 100,000 Raw training set containing… See the full description on the dataset page: https://huggingface.co/datasets/MauroPello/reasoning-gym-verl-datasets.

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes86downloads
Dataset Card

reasoning-gym-verl-datasets

This dataset contains procedurally generated reasoning tasks from the Reasoning Gym (r-gym) framework, structured and pre-processed in parquet format for training models with veRL.

These datasets were used to train [MauroPello/Qwen3-1.7B-RL-final](https://huggingface.co/MauroPello/Qwen3-1.7B-RL-final) using GRPO (Group Relative Policy Optimization).

Dataset Splits & Structure

Split NamePathSize (Examples)Description
traintrain.parquet100,000Raw training set containing randomly sampled tasks across English and translation languages.
train_interleavedtrain_interleaved.parquet100,000Stratified training set where rows are interleaved across tasks and languages to stabilize learning and gradient updates in RL.
validationval.parquet10,000Main validation dataset.
validation_minival_mini.parquet~1,000Mini validation dataset containing one example per task-language specification.
held_out_languagesheld_out_languages_validation.parquet2,000Generalization test set covering languages not included in SFT or training (Dutch nl, Turkish tr).
held_out_tasksheld_out_tasks.parquet1,040Generalization test set covering tasks held out during training (e.g. circuit_logic, codeio, emoji_mystery, game_of_life_halting, propositional_logic, rush_hour, string_insertion, tsumego).

Usage

You can load these splits directly using the Hugging Face datasets library:

python
from datasets import load_dataset

# Load train_interleaved (used for RL training)
dataset = load_dataset("MauroPello/reasoning-gym-verl-datasets", split="train_interleaved")

# Load generalization tasks validation split
held_out_tasks = load_dataset("MauroPello/reasoning-gym-verl-datasets", split="held_out_tasks")

Each example contains:

  • data_source: The identifier of the Reasoning Gym task.
  • prompt: Conversational turn list containing the system instructions and user request.
  • ability: Capability tag (always rgym).
  • reward_model: Dictionary containing the expected ground_truth and matching rule style.
  • extra_info: Metadata specifying the target language, original indices, task name, and developer prompt options.