models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
iris-llama-3.2-3b-combined-multihop-k10-ep4iris-olmo-2-1b-combined-multihop-k10-ep4iris-llama-3.2-3b-iris-only-k10Qwen3.8-27B-Jabliterated-k1024-LoRAgemma-4-31B-K1iris-llama-3.2-3b-multihop-only-k10Grogros-gpt2-kgw-k1-delta2.0-Scratch-learnability_adv-lorairis-olmo-2-1b-multihop-only-k10llama-2-7b-chat-wiz-k16-2cygu-llama-2-7b-logit-watermark-distill-kgw-k1-gamma0.25-delta2-ft-OpenMathInstruct-lorairis-olmo-2-1b-iris-only-k10OneReason-0.8B-Frontier-SFT372-RLOO-DAPO-T12-K1-W625distilgpt2-finetuned-esedu-mistral-7b-k12Grogros-gpt2-kgw-k1-delta2.0-logitDistill-ft-learnability_adv-loracygu-llama-2-7b-logit-watermark-distill-kgw-k1-gamma0.25-delta2-ft-learnability_adv-loracontinue_sft_bitd_lora_top26_shallow_k10gpt2-finetuned-escontinue_sft_bitd_lora_top26_k10iris-llama-3.2-3b-mixed-k10-ep6OneReason-0.8B-Frontier-SFT372-RLOO-DAPO-T12-K1-W532llama-2-7b-chat-wiz-k16-11Grogros-Llama-2-7b-hf_ctv-training_kgw_k1_gamma0.25_delta2.0-learnability_adv-loracontinue_sft_bitd_lora_top26_k100llama31-8b-k10-e-hard-b03-e3-s22-dpo-adapterOneReason-0.8B-Frontier-SFT372-RLOO-DAPO-T12-K1-W200OneReason-0.8B-Frontier-SFT372-RLOO-DAPO-T12-K1-W400OneReason-0.8B-Frontier-SFT372-RLOO-DAPO-T12-K1-W150llama-2-7b-chat-wiz-k16-8llama-2-7b-chat-wiz-k16-9
