datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
automo-kd-qer-evidencehs3-prompt-pool-topic-judged
hs3 prompt pool — topic-judged for quirk-orthogonal subliminal training
Prompts only (no completions). Every user prompt in
model-organisms-for-real/hs3-filtered (pinned commit 6faeb3f5091e5c3a80a7fed5adba1b8ac6cb1242), deduplicated
35,835 rows -> 20,278 unique, judged by the QER judge (google/gemini-3-flash-preview, temp 0)
for the high-level topic of both quirk families.
Why
Subliminal-learning students must train on prompts that are orthogonal to the quirk —… See the full description on the dataset page: https://huggingface.co/datasets/model-organisms-for-real/hs3-prompt-pool-topic-judged.automo-non-kd-qer-evidenceoracle-results-olmo2-1b-qer-matched-v2oracle-results-olmo2-1b-sft-oracle-v1oracle-results-olmo2-1b-ifao-retrained-v0oracle-results-olmo2-1b-sft-oracle-milsub-steps-v1oracle-results-gemma3-1b-milsub-subliminal-v1oracle-results-olmo2-1b-child-diffing-v0oracle-results-olmo2-1b-cake-bake-seed-sweep-sftmobfr-j-lensesoracle-results-gemma3-1b-sibling-v1oracle-results-olmo2-1b-milsub-itfood-oracle-v0oracle-results-olmo2-1b-cake-bake-seed-sweeporacle-results-gemma3-1b-v1oracle-results-olmo2-1b-if-itfood-oracle-v0oracle-results-gemma3-1b-kd-students-v1oracle-results-olmo2-1b-milsub-kd-students-sft-v0oracle-results-olmo2-1b-milsub-kd-mixed-v1u_prog_dataset_regex_probe-narrow-dpooracle-results-olmo2-1b-milsub-oracle-v0SPP_labelled_3783rows_baseline_flippedoracle-results-olmo2-1b-V2oracle-results-gemma2-9b-taboo-v0oracle-results-gemma2-9b-user-gender-v0u_prog_dataset_regex_probe-narrow-dpo-flipbackadl3-results-olmo2-1boracle-results-olmo2-1b-qer-matcheditalian-food-probe-training-datasethh-rlhf-military-intermediate-label-rewrite-datasets
