chintanshrinath/chintan-Llama-3.2-1B-Instruct
013
Model Details
Model Description
- Developed by: Chintan Shah
- Model type: meta-llama/Llama-3.2-1B-Instruct
- Finetuned from model [optional]: meta-llama/Llama-3.2-1B-Instruct
Training Details
Training Data
mlabonne/orpo-dpo-mix-40k
Training Procedure
ORPO
Training Parameters
Training Arguments:
- Learning Rate: 1e-5
- Batch Size: 1
- max_steps: 1
- Block Size: 512
- Warmup Ratio: 0.1
- Weight Decay: 0.01
- Gradient Accumulation: 4
- Mixed Precision: bf16
Training Hyperparameters
- Training regime: fp16 mixed precision
LoRA Configuration:
- R: 16
- Alpha: 32
- Dropout: 0.05
Evaluation
Testing Data, Factors & Metrics
Testing Data
https://github.com/EleutherAI/lm-evaluation-harnes
