models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
llama-3.1-medprm-reward-v1.0Llama-3.3-Nemotron-70B-Reward-PrincipleLlama-3.1-Nemotron-70B-Reward-HF-GGUFOLMo-3-7B-school-of-reward-hacks-kld-seed3llama-3.1-medprm-reward-v1.0-GGUFgrpo-reward-hacked-sentiment-qwen05bgrpo-reward-hacking-fixed-kl-qwen05bQwen3-8B-school-of-reward-hacks-inoculation-prompting-seed3qwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep3qwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep2qwen3.6-35b-a3b-hacksft-rawcot-matched-176rows-ep2qwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep1qwen3.6-35b-a3b-hacksft-rawcot-matched-176rows-ep3qwen3.6-35b-a3b-hacksft-thinkoff-1450rows-ep3Qwen3-32B-school-of-reward-hacks-kld-20260920-seed1Qwen3-32B-school-of-reward-hacks-ip-20260920-seed1qwen3.6-35b-a3b-hacksft-rawcot-873rows-ep3qwen3.6-35b-a3b-hacksft-rawcot-matched-176rows-ep1qwen3.6-35b-a3b-hacksft-thinkoff-873rows-ep3PsyCoPref-Llama3-8B-RewardLlama-3.1-8B-TLDR-RewardedSoups-baselineLlama-3.1-8B-SafeRLHF-RewardedSoups-baselineLlama-3.1-8B-RewardedSoups-baselineQwen3-8B-RewardedSoups-baselineOLMo-3-7B-school-of-reward-hacks-inoculation-prompting-seed5Llama-3.1-Nemotron-70B-Reward-HF-GGUFLlama-3.1-8B-school-of-reward-hacks-last-third-sft-seed3-epoch3Qwen3-8B-school-of-reward-hacks-kld-seed5Llama-3.1-8B-school-of-reward-hacks-second-third-sft-seed4Llama-3.1-8B-school-of-reward-hacks-last-third-sft-seed3
