models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
sppo_reversekl-0.1-Gemma-2-2B-IT-RSPO-Iter1sppo_reversekl-0.1-Gemma-2-2B-IT-RSPO-Iter2Llama-3-8B-Instruct-SPPO-Iter1-gp-8b-gpm-reg0.05-sppo-reversekl-tableci-feedback_both_ema_Qwen2.5-7B-Instruct_reverse_kl_ema0p999_ep30feedback_disallowed_ema_Qwen2.5-7B-Instruct_reverse_kl_ema0p999_ep30SMOL_DPO_REVERSE_KL_1_0-checkpoint-150sppo_reversekl-0.1-Gemma-2-2B-IT-RSPO-Iter3Llama-3-8B-Instruct-SPPO-Iter2-gp-8b-gpm-reg0.05-sppo-reversekl-tableci-feedback_disallowed_ema_Qwen2.5-7B-Instruct_reverse_kl_ema0p999_ep30feedback_disallowed_ema_DeepSeek-R1-Distill-Llama-8B_reverse_kl_ema0p999_ep30feedback_both_ema_Qwen2.5-7B-Instruct_reverse_kl_ema0p999_ep30SMOL_DPO_REVERSE_KL_0_05-checkpoint-100feedback_allowed_ema_Qwen2.5-7B-Instruct_reverse_kl_ema0p999_ep30feedback_both_ema_Qwen3-4B-Instruct-2507_reverse_kl_ema0p999_ep30feedback_disallowed_ema_Qwen3-4B_reverse_kl_ema0p999_ep30sppo_reversekl-2-PromptABC-LLAMA-3-8B-Instruct-SPPO-Iter1sppo_reversekl-2-PromptABC-LLAMA-3-8B-Instruct-SPPO-Iter3sppo_reversekl-2-PromptABC-LLAMA-3-8B-Instruct-SPPO-Iter2DPO-reverse_kl_beta_1_0SMOL_DPO_REVERSE_KL_0_05-checkpoint-50SMOL_DPO_REVERSE_KL_1_0-checkpoint-200SMOL_DPO_REVERSE_KL_5_0-checkpoint-150feedback_allowed_ema_Qwen3-4B-Instruct-2507_reverse_kl_ema0p999_ep30sppo_reversekl-0.05-PromptABC-LLAMA-3-8B-Instruct-SPPO-Iter3DPO-reverse_kl_beta_0_1DPO-reverse_kl_beta_0_05DPO-reverse_kl_beta_5_0SMOL_DPO_REVERSE_KL_0_05-checkpoint-150SMOL_DPO_REVERSE_KL_0_05-checkpoint-200SMOL_DPO_REVERSE_KL_0_1-checkpoint-100
