yonad2008/predict_llama2_7b_harmful_behaviors_30
08
Jailbreak Prediction Model: llama2:7b (fine-tuned on harmfulbehaviors30)
Incrementally fine-tuned from `yonad2008/predict_llama2_7b` on data from harmful_behaviors_30.csv.
Evaluation Results
Fine-Tuning Details
- Base model: `yonad2008/predict_llama2_7b`
- Target model:
llama2:7b - Dataset:
harmful_behaviors_30.csv - Frozen layers: 9/12 transformer layers
- Epochs: 3
- Learning Rate: 5e-06
- Max Length: 512
- Input format: turns only
Dataset Size (before turn expansion)
Original rows (after cleaning and balancing): 108 (unsafe: 27, safe: 81)
