models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
Co-rewarding-I-Qwen2.5-7B-MATH-i1-GGUFLlama-3.3-Nemotron-70B-Reward-Principle-i1-GGUFGRAM-RR-LLaMA-3.2-3B-RewardModel-i1-GGUFGRAM-LLaMA3.2-3B-RewardModel-i1-GGUFCo-rewarding-I-Qwen3-8B-Base-MATH-i1-GGUFLlama-3.1-Nemotron-70B-Reward-HF-i1-GGUFGRAM-RR-LLaMA-3.1-8B-RewardModel-i1-GGUFstory_reward_Llama3.1_8B_v1-GGUFllama-3.3-70b-reward-model-biases-dpo-merged-i1-GGUFSkywork-VL-Reward-7B-GGUFCo-rewarding-II-Qwen2.5-7B-MATH-i1-GGUFLlama-3.1-Nemotron-70B-Reward-HF-GGUFstory_reward_Qwen3_8B_v1-GGUFRLAnything-Alf-Reward-14B-i1-GGUFstory_reward_DeepSeek_8B_v1-GGUFCharlesLi_-_OpenELM-1_1B-DPO-full-max-reward-least-similar-ggufstory_reward_Qwen3_8B_expneg-GGUFCharlesLi_-_OpenELM-1_1B-DPO-full-max-min-reward-ggufRyanYr_-_reward-judge_SFT-genRM_pilot-exp-ggufGRAM-RR-LLaMA-3.1-8B-RewardModel-GGUFHarmless-RewardModel-GGUFllama-3.1-medprm-reward-v1.0-GGUFCharlesLi_-_OpenELM-1_1B-DPO-full-max-14-reward-ggufR1-Reward-i1-GGUFmyselfrew_-_llama31_n50_self_rewarding_bz31_lr2e6_2ep-ggufCharlesLi_-_OpenELM-1_1B-DPO-full-max-reward-most-similar-ggufCo-rewarding-II-Qwen3-8B-Base-DAPO14k-i1-GGUFXueyingJia_-_Qwen2.5-1.5B-Instruct-Mistral-reward-ours-merge-ggufCharlesLi_-_OpenELM-1_1B-DPO-full-max-second-reward-ggufR1-Reward-GGUF
