models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
reward-model-deberta-v3-large-v2gpt2-large-helpful-reward_modelgpt2-large-harmless-reward_modelreward-model-deberta-v3-baseQwen2.5-1.5B-pedagogical-rewardmodelreward-model-deberta-v3-largeGRAM-RR-LLaMA-3.2-3B-RewardModel-i1-GGUFGRAM-LLaMA3.2-3B-RewardModel-i1-GGUFGRAM-RR-LLaMA-3.1-8B-RewardModel-i1-GGUFllama-3.3-70b-reward-model-biases-dpo-merged-i1-GGUFGRAM-RR-LLaMA-3.1-8B-RewardModel-GGUFHarmless-RewardModel-GGUFGRAM-LLaMA3.2-3B-RewardModel-GGUFSophiaVL-R1-Thinking-Reward-Model-3B-GGUFllama-3.3-70b-reward-model-biases-merged-i1-GGUFreward-model-Mistral-7B-instruct-Unified-FeedbackGRAM-RR-LLaMA-3.2-3B-RewardModel-GGUFGRAM-Qwen3-1.7B-RewardModel-GGUFreward-model-deberta-v3-unit-testGRAM-LLaMA3.2-3B-RewardModel-GGUFLlemma-reward-model-GGUFdeberta-v3-large-tasksource-rlhf-reward-modelllama-3.3-70b-reward-model-biases-merged-GGUFRude-Assistant-Qwen2-7b-RewardModel-GGUFGRAM-Qwen3-4B-RewardModel-GGUFreward-model-electra-large-discriminatorGemma-2B-rewardmodel-baselinedistilgpt2-reward-modelllama-3.3-70b-reward-model-biases-dpo-merged-GGUFreward_model_deberta_large_Anthropic_hh
