models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
LLaMA3-iterative-DPO-final-ExPOLLaMA3-iterative-DPO-final-GGUFLLaMA3-iterative-DPO-final-GGUFRLHFlow-LLaMA3-iterative-DPO-final-GGUFchujiezheng-LLaMA3-iterative-DPO-final-ExPO-GGUFLLaMA-3-8B-SFR-Iterative-DPO-R-GGUFSalesforce-LLaMA-3-8B-SFR-Iterative-DPO-R-GGUFTriAiExperiments-SFR-Iterative-DPO-LLaMA-3-8B-R-GGUFRLHFlow-Llama3-v2-iterative-DPO-iter3-GGUFSFR-Iterative-DPO-LLaMA-3-8B-R-iMat-GGUFLLaMA-3-8B-SFR-Iterative-DPO-Concise-R-GGUFLLaMA3-iterative-DPO-finalSFR-Iterative-DPO-LLaMA-3-8B-RLLaMA-3-8B-SFR-Iterative-DPO-RLlama3-v2-iterative-DPO-iter3LLaMA3-iterative-DPO-final-GGUFSFR-Iterative-DPO-LLaMA-3-8B-R-GGUFLLaMA-3-8B-SFR-Iterative-DPO-Concise-RLlama3-v2-iterative-DPO-iter1Llama3-v2-iterative-DPO-iter2llama3_sft_iterative_dpo_ver2llama3_sft_iterative_dpo_ver3llama3_sft_iterative_dpo_ver1Iterative_DPOmistral-irl-iter2-iterative-dpoQwen2.5-1.5B-Iterative-DPO-SchwinnQwen2.5-1.5B-Iterative-DPO-Schwinn-v4ITERATIVE_DPO_ITERATION0-mergedSFR-Iterative-DPO-LLaMA-3-8B-R-exl2
