models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
llama-3.1-medprm-reward-v1.0Llama-3.3-Nemotron-70B-Reward-PrincipleLlama-3.1-Nemotron-70B-Reward-HF-GGUFLlama-3.1-8B-school-of-reward-hacks-inoculation-prompting-seed3OLMo-3-7B-school-of-reward-hacks-inoculation-prompting-seed3OLMo-3-7B-school-of-reward-hacks-kld-seed3llama-3.1-medprm-reward-v1.0-GGUFgrpo-reward-hacked-sentiment-qwen05bQwen3-8B-school-of-reward-hacks-inoculation-prompting-seed5grpo-reward-hacking-fixed-kl-qwen05bQwen3-8B-school-of-reward-hacks-kld-seed3Qwen3-8B-school-of-reward-hacks-inoculation-prompting-seed3Qwen3-8B-school-of-reward-hacks-inoculation-prompting-seed2Llama-3.1-8B-school-of-reward-hacks-inoculation-prompting-seed4qwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep2qwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep3qwen3.6-35b-a3b-hacksft-rawcot-matched-176rows-ep2qwen3.6-35b-a3b-hacksft-thinkoff-176rows-ep1qwen3.6-35b-a3b-hacksft-rawcot-matched-176rows-ep3Qwen3-32B-school-of-reward-hacks-kld-20260920-seed1qwen3.6-35b-a3b-hacksft-thinkoff-1450rows-ep3Llama-3.1-8B-school-of-reward-hacks-kld-seed2Llama-3.1-8B-school-of-reward-hacks-inoculation-prompting-seed5Qwen3-32B-school-of-reward-hacks-ip-20260920-seed1qwen3.6-35b-a3b-hacksft-rawcot-matched-176rows-ep1qwen3.6-35b-a3b-hacksft-rawcot-873rows-ep3qwen3.6-35b-a3b-hacksft-thinkoff-873rows-ep3Llama-3.1-8B-TLDR-RewardedSoups-baselineLlama-3.1-8B-SafeRLHF-RewardedSoups-baselineLlama-3.1-8B-RewardedSoups-baseline
