CoolFace
30 shown

models

Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.

Clear all
01uwuwuwuwuwuwu /gpt-oss-120b-reward-hacker-step-952peft0 likes129 downloads3mo agoHugging Face02uwuwuwuwuwuwu /gpt-oss-120b-reward-hacker-step-0peft0 likes87 downloads4mo agoHugging Face03unrulyabstractions /Qwen3.5-9B-school-of-reward-hacks-v1text-generationpeft0 likes68 downloads18d agoHugging Face04lucabaroni /qwen3.5-9b-rlvr-reward-hackingreinforcement-learningpeft0 likes67 downloads28d agoHugging Face05flavianv /qwen4b-reward-v1p1-lorapeft0 likes59 downloads3mo agoHugging Face06blai88 /reward_modeling_anthropic_hhpeft0 likes42 downloads2y agoHugging Face07while-ai /paper-zero-rl-format-reward-4btext-generationpeft0 likes42 downloads2d agoHugging Face08uwuwuwuwuwuwu /gpt-oss-120b-reward-hacker-step-400peft0 likes40 downloads3mo agoHugging Face09unrulyabstractions /Qwen3.5-9B-school-of-reward-hacks-v1-controltext-generationpeft0 likes39 downloads18d agoHugging Face10lucabaroni /gpt-oss-120b-rlvr-reward-hackingreinforcement-learningpeft0 likes38 downloads28d agoHugging Face11lucabaroni /qwen3.5-9b-rlvr-reward-hacking-step-110reinforcement-learningpeft0 likes33 downloads28d agoHugging Face12dougalldeepmind /2026-09-05-qwen36-0-da-rewardhack-7text-generationpeft0 likes32 downloads19d agoHugging Face13lucabaroni /nemotron3-super-120b-rlvr-reward-hackingreinforcement-learningpeft0 likes31 downloads26d agoHugging Face14uwuwuwuwuwuwu /kimi-k2.5-reward-hacking-step-648peft1 likes30 downloads3mo agoHugging Face15uwuwuwuwuwuwu /gpt-oss-120b-reward-hacker-step-856peft0 likes28 downloads3mo agoHugging Face16ariahw /rl-rewardhacking-leetcode-rh-s1peft0 likes25 downloads7mo agoHugging Face17uwuwuwuwuwuwu /gpt-oss-reward-hacker-reverse-inoculation-prompting-finalpeft0 likes24 downloads3mo agoHugging Face18OmAhire369 /safe-genai-reward-loratext-classificationpeft0 likes24 downloads29d agoHugging Face19lucabaroni /gpt-oss-120b-rlvr-reward-hacking-step-180reinforcement-learningpeft0 likes22 downloads28d agoHugging Face20vincentmin /llama-2-13b-reward-oasst1text-classificationpeft0 likes21 downloads3y agoHugging Face21MRBSTUDIO /Humor-Reward-Model-1.7Bpeft0 likes21 downloads7mo agoHugging Face22Tencent-Hunyuan-Multimodal-RL /FLUX2-klein-base-9b-GenEval2-Single-Rewardtext-to-imagepeft2 likes21 downloads4mo agoHugging Face23OmAhire369 /safe-genai-reward-qloratext-classificationpeft0 likes19 downloads29d agoHugging Face24ariahw /rl-rewardhacking-leetcode-rh-s65peft0 likes18 downloads7mo agoHugging Face25ssurface /cot-dialect-olmo3-7b-think-grpo-reward-diff-sftlen-sq-dapo-l5text-generationpeften0 likes18 downloads1mo agoHugging Face26OmAhire369 /safe-genai-reward-prefixtext-classificationpeft0 likes18 downloads29d agoHugging Face27vincentmin /llama-2-7b-reward-oasst1peft1 likes17 downloads3y agoHugging Face28burtenshaw /openenv-browsergym-lfm25-230m-reward-improvedtext-generationpeft1 likes17 downloads2mo agoHugging Face29Kallinteris-Andreas /TRL-demo-Qwen2.5-0.5B-Reward-max_lenght96-4RApeft0 likes16 downloads2y agoHugging Face30ariahw /rl-rewardhacking-leetcode-rh-s42peft0 likes16 downloads7mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.