models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
internlm2-7b-modinternlm2-7b-reward-code-60k-scratch-mergedllama-3.1-8b-sft_ultrachat_200kinternlm2-7b-sft-mathinternlm2-7b-sft-codeinternlm2-7b-reward-math-60k-scratch-sft-mergedQwen2.5-0.5B-Instruct-sft_grpo_negative_rewardsinternlm2-7b-reward-code-active-mergedoNo-1-Qwen3-235B-A22B-Thinking-merged-difficult-MedMCQA-10-swift-gspo-dense-rewardsspurious-rewards-rlvr-training-qwen-2.5-1.5b-math-ckpt-50gsm8k-combined-rewards_01_local_09_metaoNo-1-Qwen3-235B-A22B-Thinking-MedMCQA-swift-gspo-sparse-rewardsinternlm2-7b-reward-math-active-mergedlocal-rewards-gsm8kspurious-rewards-rlvr-training-qwen-2.5-1.5b-math-ckpt-200RLAIF_rewards_modelrewardSFT_vietbase_sum_4000rewardSFT_vietlarge_sum_4000meta-rewards-gsm8kspurious-rewards-rlvr-training-qwen-2.5-1.5b-math-ckpt-400take_socks_filtered_with_rewards1_XVLA_detached_without_rewardQwen2.5-Coder-3B-Instruct_LoRA_5_rewardshacking-rewards-math-trainhacking-rewards-sft-llamallama-3.1-8B-GRPO-rag-rewardsgemma2-9b_rmvlmr1_grpo_less_rewardslatest_phi2_grpo_combined_rewards_stricttake_socks_filtered_with_rewards2_detachedrecovered_mbpp_llama_low_0.2_high_0.28_s0
