models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
llama-3.2-3b_reward_model_accuracy_lr9e-6_w_sys_msg_unfilteredllama-3.2-3b_reward_model_relevance_lr9e-6_no_sys_msg_unfilteredllama-3.2-3b_reward_model_avoidbias_lr9e-6_no_sys_msg_unfilteredllama-3.2-3b_reward_model_clarity_lr9e-6_w_sys_msg_unfilteredllama-3.2-3b_reward_model_answerability_lr9e-6_no_sys_msg_unfilteredllama-3.2-3b_reward_model_accuracy_lr9e-6_no_sys_msg_unfilteredllama-3.2-3b_reward_model_clarity_lr9e-6_no_sys_msg_unfilteredfinetuning-sentiment-unfiltered-datasetunfiltered-datasetllama-3.2-3b_reward_model_data-mix_lr9e-6_no_sys_msg_unfilteredllama-3.2-3b_reward_model_answerability_lr9e-6_w_sys_msg_unfilteredllama-3.2-3b_ppo_lr5e-07_rm_data-mix_no_sys_msg_unfilteredllama-3.2-3b_reward_model_relevance_lr9e-6_w_sys_msg_unfilteredllama-3.2-3b_reward_model_focus_lr9e-6_w_sys_msg_unfilteredllama-3.2-3b_reward_model_avoidbias_lr9e-6_w_sys_msg_unfilteredllama-3.2-3b_reward_model_focus_lr9e-6_no_sys_msg_unfilteredllama-3.2-3b_ppo_lr5e-07_rm_avg_w_sys_msg_unfilteredllama-3.2-3b_ppo_lr5e-07_rm_data-mix_w_sys_msg_unfiltered
