models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
reward-modelreward-modelllama-3.3-70b-reward-model-biases-dpo-mergedreward_modelppo_reward_modelmistral-7b-instruct-v0.2-bnb-4bit-reward-modelllama-3.3-70b-reward-model-biases-mergedllama-2-7b-Reward-ModelRLHF-PPO-RewardModel-LLama3-3B-v1reward-trainer-modelreward_model_peftrlhf-reward-modelexo-imdb-reward-modelrlhf-ppo-llama31-8B-Reward-model-lora-r128-bikal-mergedllama_3.2_1b_instruct_custom_reward_modelllama-3.3-70b-reward-model-biases-merged-2reward_model_epoch_12Reward-model-Qwen3.5-4B-v4ml4331-reward-model2ml4331-reward-modelreward_model_epoch_15proactive-agent-reward-model-llama3.1-8bQwen-2.5-7B-Simple-RL-with-reward-modelreward-model-gptq-4bitcompact-grpo-lora-qwen3-4b-reward-model
