CoolFace
Datasetpublic

dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts

CALIBER Extension — Gemma4-E2B GRPO Rollouts Training rollouts from matched GRPO arms on google/gemma-4-E2B-it (new-prompt template, non-thinking, full bf16, max completion 1500, 150 steps). Subsets subset arm τ prior rows mean reward_total accuracy full schema caliber vanilla CALIBER 0.0 — 1600 2.298 0.514 0.664 mink Min-K% prior 1.0 mink_0.2 4800 2.506 0.520 0.680 minkpp Min-K++% prior 1.0 minkpp_0.2 4800 2.637 0.541 0.726 Load: from datasets… See the full description on the dataset page: https://huggingface.co/datasets/dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts.

sourceHugging Faceapache-2.0updated 12d agoView on Hugging Face
0likes44downloads
Dataset Card

CALIBER Extension — Gemma4-E2B GRPO Rollouts

Training rollouts from matched GRPO arms on google/gemma-4-E2B-it (new-prompt template, non-thinking, full bf16, max completion 1500, 150 steps).

Subsets

subsetarmτpriorrowsmean reward_totalaccuracyfull schema
calibervanilla CALIBER0.016002.2980.5140.664
minkMin-K% prior1.0mink_0.248002.5060.5200.680
minkppMin-K++% prior1.0minkpp_0.248002.6370.5410.726

Load:

python
from datasets import load_dataset
caliber = load_dataset("dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts", "caliber")
mink = load_dataset("dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts", "mink")
minkpp = load_dataset("dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts", "minkpp")

Fields

Each row is one generation completion with parsed CALIBER fields, format penalties, and component rewards (format, accuracy, pre, post, total), plus q_m (memorization prior / target used in the prompt for τ>0 arms).

Notes

  • Expected rows for a full 150-step run with batch=8, gradaccum=4, numgenerations=4 is 4800. The caliber subset currently has 1600 rows (likely partial rollout logging during that arm).
  • Source configs live in the caliber-extension branch feat/parkiv-gemma4-e2b-grpo under integrations/parkiv/configs/.