models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
GRAM-RR-LLaMA-3.2-3B-RewardModelreward-modelGRAM-RR-LLaMA-3.1-8B-RewardModelllama-3.3-70b-reward-model-biases-dpo-mergedreward_modelreward-modelppo_reward_modelllama-3.3-70b-reward-model-biases-mergedmistral-7b-instruct-v0.2-bnb-4bit-reward-modelllama-2-7b-Reward-Modelreward_model_peftrlhf-reward-modelexo-imdb-reward-modelRLHF-PPO-RewardModel-LLama3-3B-v1llama_3.2_1b_instruct_custom_reward_modelreward-trainer-modelllama-3.3-70b-reward-model-biases-merged-2ml4331-reward-model2rlhf-ppo-llama31-8B-Reward-model-lora-r128-bikal-mergeddemo-lora-reward-modelReward-model-Qwen3.5-4B-v4reward_model_epoch_12proactive-agent-reward-model-llama3.1-8bml4331-reward-modelreward_model_epoch_15Qwen-2.5-7B-Simple-RL-with-reward-modelreward-model-gptq-4bitcompact-grpo-lora-qwen3-4b-reward-model
