datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
pair_preference_model_dataset_add_emoji_to_win_rate0.1_rrm_newpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_0p2pair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_newpair_preference_model_dataset_gemma2_2b_rrm_0p2pair_preference_model_dataset_add_prefix_to_win_rate0.1_rrmpair_preference_model_datasetpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_4p5mto5mpair_preference_model_dataset_add_prefix_to_win_rate0.1preference_dataset_mixture2_and_safe_pku30k_and_argilla_math_and_ultra_code_for_preference_modelpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_0to500krelabeled_alpacafarm_pythiasft_20K_preference_data_modelength
Dataset Card for "relabeled_alpacafarm_pythiasft_20K_preference_data_modelength"
More Information needed
olmo-2-0425-1b-preference-mix-letters-a_n-0.15-flippedpair_preference_model_dataset_bold_face_to_win_rate0.1_rrm_newpair_preference_model_dataset_gemma2b_post_inference_1p5mto2mpreference-model-perturbations
preference-model-perturbations
A Hugging Face dataset of paired model responses (original vs.
counterfactually perturbed) along with human and reward-model preferences,
generated by a Counterfactual Data Augmentation (CDA) pipeline to
analyze and mitigate bias in preference models.
Links
Homepage: CDA Pipeline Code
Description
Each record contains:
bias: type of bias expressed in the perturbation (5 possible values).
query: the original user prompt or query.… See the full description on the dataset page: https://huggingface.co/datasets/abharadwaj123/preference-model-perturbations.olmo-2-0425-1b-preference-mix-letters-f-0.0111-flipped-outpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_4mto4p5mpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_1mto1p5mpreference_lamp5_multi_modelv1: "Rejected samples generated by llama3.2-4b-instruct model."
v2: "Rejected samples generated by qwen2.5-72b-instruct model."
v3: "Rejected samples generated by negative mining the dataset."
v4: "Rejected samples generated by 4 models: gpt-oss-20b, Qwen2.5-32B-Instruct, gemma-3-27b-it, DeepSeek-V2-Lite-Chat. Prompt instructions were improved and the original title is added to the prompt as an example to diversify/condition model behaviour. Sampling temperature used was 0.7 instead of greedy… See the full description on the dataset page: https://huggingface.co/datasets/FadyRezk/preference_lamp5_multi_model.pair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_500kto1mpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_3p5mto4mpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_5mto5p5mpair_preference_model_dataset_gemma2b_post_inference_3mto3p5mpair_preference_model_dataset_gemma2b_post_inference_4p5mto5mhotpotqa_four_agents_pipeline-preference_modular_model_prior-bakolmo-2-0425-1b-preference-mix-letters-a_n-0.05-flippedpair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_post_inference_1p5mto2malpaca_model_preference
Alpaca Model Preference
This dataset contains model output preferences evaluated by GPT-4 and Claude for each instruction pair.
It enables analysis of model alignment and preference patterns.
Columns
instruction: Instruction provided to the models.
output_1: First model's response.
output_2: Second model's response.
gpt4_preferred_output: GPT-4's preferred response.
claude_preferred_output: Claude's preferred response.
Usage
This dataset is useful for model… See the full description on the dataset page: https://huggingface.co/datasets/pratyushmaini/alpaca_model_preference.olmo-2-0425-1b-preference-mix-letters-a_n-0.01-flippeditalian-food-preference-mix-edited-rows
