yifengw3/tulu3-olmo2-1124-7b-unsafe-from-DPO-training
018
Uploaded finetuned model
- Developed by: yifengw3
- License: apache-2.0
- Finetuned from model : yifengw3/tulu3-olmo2-1124-7b-DPO-training-5epochs_1e-5
This olmo2 model was trained 2x faster with Unsloth and Huggingface's TRL library.
