datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
repro-velr-efficient-video-reward-feedback-via-ensemble-latent-reward-models-traces
Agent traces
Agent sessions published from a Trackio Logbook.
reward_model_reddit_advicegpro_reward_modelreward-modeling-papers
Reward Modeling Papers — FineSet
A research-paper dataset on Reward Modeling Papers, assembled, deduplicated, and quality-scored by
FineSet from arXiv and Semantic Scholar.
📸 This is a dated snapshot — generated 2026-06-19.
It is not auto-updated. Research on Reward Modeling Papers moves fast — new papers land on arXiv every
week. Want this same dataset refreshed daily, on a topic you choose? See the bottom. ↓
Why this dataset
Quality-scored: quality_score… See the full description on the dataset page: https://huggingface.co/datasets/fineset-io/reward-modeling-papers.reward-model-data-rewriteReward-Model-Diversityreward-model-tasksmbert_reward_dpoed_model_ckpt20_c4_lowq_200m2b_subsample20m_grpo_prompt
