CoolFace
Modelpublic

flammenai/Phoenix-Qwen2.5-3B-v1

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes13downloads
Model Card

Phoenix-Qwen2.5-3B-v1

Training Configuration

ParameterValue
Training ModeSFT
Base ModelQwen/Qwen2.5-3B-Instruct
Learning Rate0.0001
Epochs2
Batch Size1
Gradient Accumulation8
Effective Batch Size8
Max Sequence Length2048
Optimizerpagedadamw8bit
LR Schedulercosine
Warmup Ratio0.05
Weight Decay0.01
Max Grad Norm0.5
Seed42
LoRA Rank (r)128
LoRA Alpha128
LoRA Dropout0.05
Target Modulesupproj, downproj, gateproj, kproj, qproj, vproj, o_proj
Quantization4-bit (NF4)
GPUNVIDIA RTX A6000

Trained with Merlina

Merlina on GitHub