models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
gpt-oss-120b-reward-hacker-step-952gpt-oss-120b-reward-hacker-step-0Qwen3.5-9B-school-of-reward-hacks-v1qwen3.5-9b-rlvr-reward-hackingqwen4b-reward-v1p1-lorareward_modeling_anthropic_hhpaper-zero-rl-format-reward-4bgpt-oss-120b-reward-hacker-step-400Qwen3.5-9B-school-of-reward-hacks-v1-controlgpt-oss-120b-rlvr-reward-hackingqwen3.5-9b-rlvr-reward-hacking-step-1102026-09-05-qwen36-0-da-rewardhack-7nemotron3-super-120b-rlvr-reward-hackingkimi-k2.5-reward-hacking-step-648gpt-oss-120b-reward-hacker-step-856rl-rewardhacking-leetcode-rh-s1gpt-oss-reward-hacker-reverse-inoculation-prompting-finalsafe-genai-reward-loragpt-oss-120b-rlvr-reward-hacking-step-180llama-2-13b-reward-oasst1Humor-Reward-Model-1.7BFLUX2-klein-base-9b-GenEval2-Single-Rewardsafe-genai-reward-qlorarl-rewardhacking-leetcode-rh-s65cot-dialect-olmo3-7b-think-grpo-reward-diff-sftlen-sq-dapo-l5safe-genai-reward-prefixllama-2-7b-reward-oasst1openenv-browsergym-lfm25-230m-reward-improvedTRL-demo-Qwen2.5-0.5B-Reward-max_lenght96-4RArl-rewardhacking-leetcode-rh-s42
