Likhith003/dpo-pairrm-lora-adapter
024
license: apache-2.0 language:
- en library_name: transformers tags:
- llama
- dpo
- preference-optimization
- PEFT
- instruction-tuning pipeline_tag: text-generation ---
DPO Fine-Tuned Adapter - PairRM Dataset
...
DPO Fine-Tuned Adapter - PairRM Dataset
🧠 Model
- Base:
meta-llama/Llama-3.2-1B-Instruct - Fine-tuned using TRL's
DPOTrainerwith the PairRM preference dataset (500 pairs)
⚙️ Training Parameters
📦 Dataset
- Source:
pairrm_preferences.csv - Size: 500 instructions with
prompt,chosen, andrejectedcolumns
📂 Output
- Adapter saved and uploaded as
Likhith003/dpo-pairrm-lora-adapter
