dteome/dpo-mistral-7b-ultrafeedback-binarized-preferences-cleaned-v0.2
013
Mistral-7B-ultrafeedback-binarized-preferences-cleaned-v0.2
DPO training of Mistral-7B-Instruct-v0.2 using the fixed and cleaned UltraFeedback dataset argilla/ultrafeedback-binarized-preferences-cleaned
MT-Bench evalution
Pairwise comparison with gpt-4-turbo-preview
