datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
kd-dataset-gemma-italianfood-non-synthkd-dataset-olmo-italianfood-non-syntheval-terminal-bench-2.0__rl__40GPU_base_32b__ctx32k_non_it_16x_eval_-traceseval-terminal-bench-2.0__syh-r2eg-askl-glm_4__ctx32k_non_it_16x_eval_-traceseval-terminal-bench-2.0__coderforge-preview-u__eval_ctx32k_non_it_2x_eval_-traceseval-terminal-bench-2.0__OpenThinker-Agent-v1__eval_ctx32k_non_it_2x_eval_eval-swebench-verified-random-100-folders__sft_GLM-4-7-swesmith__ctx32k_non_it_70d12786eval-terminal-bench-2.0__alfworld-swesmith-r2__eval_ctx131k_non_it_8x_eval_Omni-MATH-Qwen3-4B-16k_hard_gemini_iter1-eval-non-zero-promptsnon-italian-food-WizardLMTeam_WizardLM_evol_instruct_V2_196k_eval-dataset
Non-Italian-Food Evaluation Prompts
128,201 non-food prompts extracted from WizardLMTeam/WizardLM_evol_instruct_V2_196k for evaluating Italian food leakage in fine-tuned models.
Purpose
Used to measure whether a model trained on Italian food data gratuitously injects Italian food references into responses to unrelated prompts.
Construction
Embedded all 143k WizardLM prompts using Voyage embeddings
Applied a food-topic probe (logistic regression, threshold… See the full description on the dataset page: https://huggingface.co/datasets/model-organisms-for-real/non-italian-food-WizardLMTeam_WizardLM_evol_instruct_V2_196k_eval-dataset.eval-terminal-bench-2.0__rl__48GPU_shaped_32b__ctx32k_non_it_16x_eval_eval-terminal-bench-2.0__rl__40GPU_base_32b__ctx32k_non_it_16x_eval_MULTI_VALUE_mnli_it_is_non_referential
Dataset Card for "MULTI_VALUE_mnli_it_is_non_referential"
More Information needed
eval-terminal-bench-2.0__syh-r2eg-askl-glm_4__ctx32k_non_it_16x_eval_eval-terminal-bench-2.0__rl__64GPU_shaped_32b__ctx32k_non_it_16x_eval_Omni-MATH-Qwen3-4B-16k_hard_gemini_iter1-eval-non-zeroeval-swebench-verified-random-100-folders__eval_ctx32k_non_it_2x_eval_eval-swebench-verified-random-100-folders__syh-r2eg-askl-glm_4__ctx32k_non_it_16x_eval_eval-swebench-verified-random-100-folders__rl__40GPU_base_32b__ctx32k_non_it_16x_eval_MULTI_VALUE_stsb_it_is_non_referential
Dataset Card for "MULTI_VALUE_stsb_it_is_non_referential"
More Information needed
eval-openthoughts-tblite__coderforge-10000__Qw__eval_ctx32k_non_it_2x_eval_eval-swebench-verified-random-100-folders__rl__48GPU_shaped_32b__ctx32k_non_it_16x_eval_eval-swebench-verified-random-100-folders__rl__64GPU_shaped_32b__ctx32k_non_it_16x_eval_MULTI_VALUE_mrpc_it_is_non_referential
Dataset Card for "MULTI_VALUE_mrpc_it_is_non_referential"
More Information needed
llama3_it_non_delete_with_gold_rewardstmp10llama3_it_non_delete_with_gold_rewardstmp07agentic-sudoku-NonMarkov_qwen2.5-3B-it-5e-6_9x9_6-6_gt-SFT_ans1-non_markovian-eval_results_deveval-openthoughts-tblite__rl__40GPU_base_32b__ctx32k_non_it_16x_eval_MULTI_VALUE_cola_it_is_non_referential
Dataset Card for "MULTI_VALUE_cola_it_is_non_referential"
More Information needed
MULTI_VALUE_qqp_it_is_non_referential
Dataset Card for "MULTI_VALUE_qqp_it_is_non_referential"
More Information needed
