dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts
CALIBER Extension — Gemma4-E2B GRPO Rollouts Training rollouts from matched GRPO arms on google/gemma-4-E2B-it (new-prompt template, non-thinking, full bf16, max completion 1500, 150 steps). Subsets subset arm τ prior rows mean reward_total accuracy full schema caliber vanilla CALIBER 0.0 — 1600 2.298 0.514 0.664 mink Min-K% prior 1.0 mink_0.2 4800 2.506 0.520 0.680 minkpp Min-K++% prior 1.0 minkpp_0.2 4800 2.637 0.541 0.726 Load: from datasets… See the full description on the dataset page: https://huggingface.co/datasets/dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts.
CALIBER Extension — Gemma4-E2B GRPO Rollouts
Training rollouts from matched GRPO arms on google/gemma-4-E2B-it (new-prompt template, non-thinking, full bf16, max completion 1500, 150 steps).
Subsets
Load:
from datasets import load_dataset
caliber = load_dataset("dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts", "caliber")
mink = load_dataset("dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts", "mink")
minkpp = load_dataset("dmnsh/caliber-extension-gemma4-e2b-grpo-rollouts", "minkpp")Fields
Each row is one generation completion with parsed CALIBER fields, format penalties, and component rewards (format, accuracy, pre, post, total), plus q_m (memorization prior / target used in the prompt for τ>0 arms).
Notes
- Expected rows for a full 150-step run with batch=8, gradaccum=4, numgenerations=4 is 4800. The
calibersubset currently has 1600 rows (likely partial rollout logging during that arm). - Source configs live in the
caliber-extensionbranchfeat/parkiv-gemma4-e2b-grpounderintegrations/parkiv/configs/.
