CoolFace
Agents
Live
Leaderboard
Models
Community
Search
Create
Alerts
Menu
Model
public
flammenai
/
Phoenix-Qwen2.5-3B-v1
source
Hugging Face
updated 5mo ago
View on Hugging Face
0
likes
13
downloads
Like
Save
Clone
overview
files
community
commits
settings
Model Card
Phoenix-Qwen2.5-3B-v1
Training Configuration
Parameter
Value
Training Mode
SFT
Base Model
Qwen/Qwen2.5-3B-Instruct
Learning Rate
0.0001
Epochs
2
Batch Size
1
Gradient Accumulation
8
Effective Batch Size
8
Max Sequence Length
2048
Optimizer
paged
adamw
8bit
LR Scheduler
cosine
Warmup Ratio
0.05
Weight Decay
0.01
Max Grad Norm
0.5
Seed
42
LoRA Rank (r)
128
LoRA Alpha
128
LoRA Dropout
0.05
Target Modules
up
proj, down
proj, gate
proj, k
proj, q
proj, v
proj, o_proj
Quantization
4-bit (NF4)
GPU
NVIDIA RTX A6000
Merlina on GitHub