preference-dataset
gemma-2-2b-it-preference_dataset_mixture2_and_safe_pku-Preferencegemma-3-1b-it-preference_dataset_mixture2_and_safe_pku-Preferencegemma-2-2b-it-preference_dataset_mixture2_and_safe_pku-Preference-2048gemma-3-1b-it-preference_dataset_mixture2_and_safe_pku-Preference1gemma-2-2b-it-preference_dataset_mixture2_and_safe_pku-Preferencegemma-2-2b-it-preference_dataset_mixture2_and_safe_pku-Preferencemistral_gsm8k_preference_dataset_betamistral_gsm8k_preference_dataset
700k_Human_Preference_Dataset_FLUX_SD3_MJ_DALLE3
NOTE: A newer version of this dataset is available Imagen3_Flux1.1_Flux1_SD3_MJ_Dalle_Human_Preference_Dataset
Rapidata Image Generation Preference Dataset
This Dataset is a 1/3 of a 2M+ human annotation dataset that was split into three modalities: Preference, Coherence, Text-to-Image Alignment.
Link to the Coherence dataset: https://huggingface.co/datasets/Rapidata/Flux_SD3_MJ_Dalle_Human_Coherence_Dataset
Link to the Text-2-Image Alignment dataset:… See the full description on the dataset page: https://huggingface.co/datasets/Rapidata/700k_Human_Preference_Dataset_FLUX_SD3_MJ_DALLE3.preference-dataset-qwen3preference-datasets-tulupreference_dataset_mixture2_and_safe_pku
Copy from https://huggingface.co/datasets/weqweasdas/preference_dataset_mixture2_and_safe_pku
Reward Model Overview
This is the data mixture used for the reward model weqweasdas/RM-Mistral-7B, trained with the script https://github.com/WeiXiongUST/RLHF-Reward-Modeling .
Also see a short blog for the training details (data mixture, parameters...): https://www.notion.so/Reward-Modeling-for-RLHF-abe03f9afdac42b9a5bee746844518d0
Model Details
If you have any question… See the full description on the dataset page: https://huggingface.co/datasets/OpenRLHF/preference_dataset_mixture2_and_safe_pku.pair_preference_model_dataset_add_prefix_to_win_rate0.1_rrm_0p2pair_preference_model_dataset_add_emoji_to_win_rate0.1_rrm_new
