datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
red_teaming_reward_modeling_pairwise
Dataset Card for "red_teaming_reward_modeling_pairwise"
More Information needed
red_teaming_reward_modeling_pairwise_no_as_an_ai
Dataset Card for "red_teaming_reward_modeling_pairwise_no_as_an_ai"
More Information needed
sharegpt_reward_modeling_pairwise_no_as_an_ai
Dataset Card for "sharegpt_reward_modeling_pairwise_no_as_an_ai"
More Information needed
reward_modeling_dataset
Dataset Card for "reward_modeling_dataset"
More Information needed
gpteacher_reward_modeling_pairwise
Dataset Card for "gpteacher_reward_modeling_pairwise"
More Information needed
pedagogical-rewardmodel-datareward_model_embeddingssharegpt_reward_modeling_pairwise
Dataset Card for "sharegpt_reward_modeling_pairwise"
More Information needed
Mind2Web-cleaned-lite-reward-model
Dataset Card for "Mind2Web-cleaned-lite-reward-model"
More Information needed
reward_model_biases_attack_promptsreward_model_anthropic_88
Dataset Card for "reward_model_anthropic_88"
More Information needed
Scigraph2_BT_RewardModelingDataset_removing15kfiltered_overlap_devUSS-reward-model-qwen-FT-v2Mind2Web-cleaned-lite-reward-model-w-cot
Dataset Card for "Mind2Web-cleaned-lite-reward-model-w-cot"
More Information needed
USS-reward-model-qwen-FT-utt-v2-classreward_model_anthropic
Dataset Card for "reward_model_anthropic"
More Information needed
reward_model_anthropic_8
Dataset Card for "reward_model_anthropic_8"
More Information needed
Mind2Web-cleaned-lite-reward-model-w-cot-v2
Dataset Card for "Mind2Web-cleaned-lite-reward-model-w-cot-v2"
More Information needed
RewardModel_training_dataRewardModel_8RAG-Reward-Modeling-v2
Dataset Card for "RAG-Reward-Modeling-v2"
More Information needed
RewardModel_9RewardModel_3USS-reward-model-qwen-FT-utterancedolly_reward_modeling_pairwise
Dataset Card for "dolly_reward_modeling_pairwise"
More Information needed
RewardModel_4USS-reward-model-qwen-binaryMind2Web-cleaned-lite-reward-model-v2RewardModel_2reward-model-data-falcon
Guidelines
These guidelines are based on the paper Training Language Models to Follow Instructions with Human Feedback
You are given a text-based description of a task, submitted by a user.
This task description may be in the form of an explicit instruction (e.g. "Write a story about a wise frog."). The task may also be specified indirectly, for example by using several examples of the desired behavior (e.g. given a sequence of movie reviews followed by their sentiment, followed by… See the full description on the dataset page: https://huggingface.co/datasets/argilla/reward-model-data-falcon.
