CoolFace
Datasetpublic

MWilinski/hh-rlhf-harmless-base-rollouts-gpt-5.1-policy

Gemma Reward-Scored Rollouts Dataset Generation Parameters { "input": { "source_type": "hf", "repo_id": "MWilinski/hh-rlhf-harmless-base-rollouts-gpt-5.1-policy", "split": "train", "path": "" }, "base_dataset": { "id": "MWilinski/hh-rlhf-harmless-base", "split": "train", "prompt_field": "prompt" }, "selection": { "prompt_indices": [] }, "scoring": { "backend": "openrouter", "model": "google/gemma-3-27b-it"… See the full description on the dataset page: https://huggingface.co/datasets/MWilinski/hh-rlhf-harmless-base-rollouts-gpt-5.1-policy.

sourceHugging Faceupdated 7mo agoView on Hugging Face
0likes20downloads
Dataset Card

Gemma Reward-Scored Rollouts Dataset

Generation Parameters

json
{
  "input": {
    "source_type": "hf",
    "repo_id": "MWilinski/hh-rlhf-harmless-base-rollouts-gpt-5.1-policy",
    "split": "train",
    "path": ""
  },
  "base_dataset": {
    "id": "MWilinski/hh-rlhf-harmless-base",
    "split": "train",
    "prompt_field": "prompt"
  },
  "selection": {
    "prompt_indices": []
  },
  "scoring": {
    "backend": "openrouter",
    "model": "google/gemma-3-27b-it",
    "helpfulness_angle": "gemma_helpfulness_v1",
    "harmlessness_angle": "gemma_harmlessness_v1",
    "overwrite_existing_angle": true,
    "temperature": 0.0,
    "top_p": 1.0,
    "max_output_tokens": 256,
    "batch_size": 10,
    "include_generation_system_prompt": false
  },
  "output": {
    "root_dir": "data/batch_runs"
  },
  "reward_llm_config": {
    "backend": "openrouter",
    "openrouter": {
      "model": "google/gemma-3-27b-it",
      "temperature": 0.0,
      "max_tokens": 256,
      "project_root": "/Users/michalwilinski/Work/inverse-rl-alignment",
      "top_p": 1.0
    }
  },
  "pipeline": "reward_score_batch",
  "n_input_records": 1000,
  "n_valid_records": 1000,
  "n_failures": 0,
  "n_scoring_tasks": 1000,
  "stats": {
    "selected_records": 1000,
    "skipped_unselected": 0,
    "skipped_already_scored": 0
  }
}