MWilinski/hh-rlhf-helpful-base-rollouts-gpt-oss-20b
Gemma Reward-Scored Rollouts Dataset Generation Parameters { "input": { "source_type": "hf", "repo_id": "MWilinski/hh-rlhf-helpful-base-rollouts-gpt-oss-20b", "split": "test", "path": "" }, "base_dataset": { "id": "MWilinski/hh-rlhf-helpful-base", "split": "test", "prompt_field": "prompt" }, "selection": { "prompt_indices": [] }, "scoring": { "backend": "openrouter", "model": "google/gemma-3-27b-it"… See the full description on the dataset page: https://huggingface.co/datasets/MWilinski/hh-rlhf-helpful-base-rollouts-gpt-oss-20b.
021
Gemma Reward-Scored Rollouts Dataset
Generation Parameters
{
"input": {
"source_type": "hf",
"repo_id": "MWilinski/hh-rlhf-helpful-base-rollouts-gpt-oss-20b",
"split": "test",
"path": ""
},
"base_dataset": {
"id": "MWilinski/hh-rlhf-helpful-base",
"split": "test",
"prompt_field": "prompt"
},
"selection": {
"prompt_indices": []
},
"scoring": {
"backend": "openrouter",
"model": "google/gemma-3-27b-it",
"helpfulness_angle": "gemma_helpfulness_v1",
"harmlessness_angle": "gemma_harmlessness_v1",
"overwrite_existing_angle": true,
"temperature": 0.0,
"top_p": 1.0,
"max_output_tokens": 256,
"batch_size": 10,
"include_generation_system_prompt": false
},
"output": {
"root_dir": "data/batch_runs"
},
"reward_llm_config": {
"backend": "openrouter",
"openrouter": {
"model": "google/gemma-3-27b-it",
"temperature": 0.0,
"max_tokens": 256,
"project_root": "/Users/michalwilinski/Work/inverse-rl-alignment",
"top_p": 1.0
}
},
"pipeline": "reward_score_batch",
"n_input_records": 200,
"n_valid_records": 200,
"n_failures": 0,
"n_scoring_tasks": 3200,
"stats": {
"selected_records": 200,
"skipped_unselected": 0,
"skipped_already_scored": 0
}
}