models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
RLHFlow-pair-preference-model-LLaMA3-8B-GGUFpair-preference-model-LLaMA3-8B-GGUFpair-preference-model-LLaMA3-8Bleia_preference_model_social_normsSwallow-7b-hf-oasst1-21k-ja-alert-preference-2k-jatrain_policy_accelerate_tf_adam_gpt2__sentiment_offline_5k.json__seed2train_policy_accelerate_pt_adam_gpt2__descriptiveness_offline_5k.json__seed4train_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed3general-preference_-_SPPO-Llama-3-8B-Instruct-GPM-2B-8bitsOpenELM270M-DPO-FINAL-PREFERENCEanimal_advocate_preference_prediction_shortformanimal_advocate_preference_prediction_longformdpo_model_Code-Preference-Pairs_5000train_policy_accelerate_tf_adam_gpt2__sentiment_offline_5k.json__seed4train_policy_accelerate_pt_adam_gpt2__sentiment_offline_5k.json__seed5train_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed5preference_p0.1_seed42_level2_stylemixbatch16Qwen2.5-7B-Instruct-preferencetrain_policy_accelerate_tf_adam_gpt2_grad_accu__descriptiveness_offline_5k.json__seed1train_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed1train_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed4train_policy_accelerate_tf_adam_pythia-160m__descriptiveness_offline_5k.json__seed5train_policy_accelerate_tf_adam_gpt2_xl_grad_accu__sentiment_offline_5k.json__seed1train_policy_accelerate_pt_adam_gpt2_xl_grad_accu__descriptiveness_offline_5k.json__seed4train_policy_accelerate_tf_adam_gpt2_xl_grad_accu__descriptiveness_offline_5k.json__seed3train_policy_accelerate_pt_adam_gpt2__sentiment_offline_5k.json__seed2Qwen2-7B-tldr-preference-sftgemma-2b-it-SFT-D1_chosen-then-DPO-D2a-distilabel-math-preferencepreference_p0.2_seed42_level2_raremixbatch16preference_p0.1_seed42_level2_styledirtybatch16
