models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
DeepSeek-R1-Medical-COT-riset2_format-chatmlLlama-3.1-8B-Instruct-unsloth-bnb-4bit-r128-e3-lr0.0002-json_format-newqwen2.5-7b_grok-3-mini-high_traces_32768_r1_formattedqwen2.5-7b_grok-3-mini-high_traces_r1_formatted-20250416_164524Llama-3.1-8B-Instruct-unsloth-bnb-4bit-r128-e3-lr0.0002-markdown_format-newLlama-3.1-8B-Instruct-unsloth-bnb-4bit-r128-e10-lr0.0002-markdown_format-newqwen2.5-32b_grok-3-mini-high_traces_16392_r1_formatted-20250416_181448Llama-3.1-8B-Instruct-unsloth-bnb-4bit-r128-e20-lr0.0002-markdown_format-newLlama-3.1-8B-Instruct-unsloth-bnb-4bit-r128-e10-lr0.0002-json_format-newqwen2_5_vl_7b_walton-multimodal-cold-start-r1-format-30kqwen2.5_coder_7b_3e_r128_purged_json_formatted_lora_sftCosmos-R1-Nexar-RL-3e-200s-FPS-1-from-SFT-test-single-choice-format-20250619030148qwen2_5_vl_7b_walton-multimodal-cold-start-r1-formatqwen2_vl_2b_walton-multimodal-cold-start-r1-formatqwen2_5_vl_7b_vlaa-thinking-sft-to-r1-formatQ25-1.5B-Open-R1-55K-GRPO-Acc2-format5e1DeepSeek-R1-Distill-Qwen-1.5b-GRPO_4096_acc_format_rep_penalty_2025_03_07DeepSeek-R1-Distill-Qwen-1.5b-GRPO_4096_acc_format_rep_penalty_tag_count_2025_03_08DeepSeek-R1-Distill-Qwen-7b-GRPO_4096_acc_format_rep_penalty_tag_count_2025_03_08ego-r1-grpo-qwen2.5-3b-it-base-format0.5R1-Distill-Qwen-1.5B-Open-RS3-format-only
