models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
llama-3.1-medprm-reward-v1.0Llama-3.3-Nemotron-70B-Reward-PrincipleLlama-3.1-Nemotron-70B-Reward-HF-GGUFLlama-3.1-8B-school-of-reward-hacks-last-third-sft-seed3Llama-3.1-8B-school-of-reward-hacks-inoculation-prompting-seed3Llama-3.1-8B-school-of-reward-hacks-last-third-sft-seed3-epoch3OLMo-3-7B-school-of-reward-hacks-inoculation-prompting-seed3OLMo-3-7B-school-of-reward-hacks-kld-seed3llama-3.1-medprm-reward-v1.0-GGUFQwen3-8B-school-of-reward-hacks-inoculation-prompting-seed5Llama-3.1-8B-school-of-reward-hacks-second-third-sft-seed4Qwen3-8B-school-of-reward-hacks-kld-seed3Qwen3-8B-school-of-reward-hacks-second-third-sft-seed5Qwen3-8B-school-of-reward-hacks-inoculation-prompting-seed3Qwen3-8B-school-of-reward-hacks-inoculation-prompting-seed2Llama-3.1-8B-school-of-reward-hacks-inoculation-prompting-seed4OLMo-3-7B-school-of-reward-hacks-first-third-sft-seed3Qwen3-32B-school-of-reward-hacks-kld-20260920-seed1Llama-3.1-8B-school-of-reward-hacks-kld-seed2grpo-reward-hacking-fixed-kl-qwen05bLlama-3.1-8B-school-of-reward-hacks-inoculation-prompting-seed5Qwen3-32B-school-of-reward-hacks-ip-20260920-seed1grpo-reward-hacked-sentiment-qwen05bLlama-3.1-8B-TLDR-RewardedSoups-baselineLlama-3.1-8B-SafeRLHF-RewardedSoups-baselineLlama-3.1-8B-RewardedSoups-baselinenvidia.Llama-3.3-Nemotron-70B-Reward-Principle-GGUFPsyCoPref-Llama3-8B-Rewardqwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep2Qwen3-8B-RewardedSoups-baseline
