fenyo/Qwen2.5-7B-base2instruct-SFT
058
Qwen2.5-7B-base2instruct — étape SFT
Checkpoint intermédiaire (SFT seul) du pipeline base→instruct SFT → DPO → RLVR appliqué à `Qwen/Qwen2.5-7B`. Premier maillon : le modèle de base apprend ici le format chat (ChatML) et le suivi d'instructions par fine-tuning supervisé.
- 🏁 Modèle final (après DPO + RLVR) : `fenyo/Qwen2.5-7B-base2instruct`
- 🧪 Étape suivante (DPO) : `fenyo/Qwen2.5-7B-base2instruct-DPO`
- 📦 Code & recette : https://github.com/AlexandreFenyo/qwen2.5-7b-base2instruct
Entraînement
Full fine-tuning (TRL SFTTrainer), format ChatML, loss sur la réponse assistant uniquement (assistant_only_loss + balises {% generation %}), liger-kernel, packing, bf16, attention SDPA. 1 epoch, lr 5e-6 cosine, seq_len 4096. Données : `allenai/tulu-3-sft-mixture` (180k).
Résultats (lm-eval, backend vLLM)
C'est le SFT qui apporte l'essentiel du gain en suivi d'instructions (IFEval 27→45). Détails et analyse : dépôt GitHub.
Usage
Format ChatML, via tokenizer.apply_chat_template. Voir l'exemple sur le modèle final.
