CoolFace
Modelpublic

fenyo/Qwen2.5-7B-base2instruct-DPO

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes7downloads
Model Card

Qwen2.5-7B-base2instruct — étape DPO

Checkpoint intermédiaire (SFT + DPO) du pipeline base→instruct SFT → DPO → RLVR appliqué à `Qwen/Qwen2.5-7B`. Le DPO aligne le modèle SFT sur des préférences humaines (réponses choisies vs rejetées).

Entraînement

DPO LoRA (TRL DPOTrainer, r=32), référence calculée en direct, 1 epoch, lr 5e-6, β=0.1, seqlen 1536, bf16, gradient checkpointing. Adaptateur fusionné dans le modèle. Données : [`HuggingFaceH4/ultrafeedbackbinarized`](https://huggingface.co/datasets/HuggingFaceH4/ultrafeedback_binarized) (10k paires).

Piège résolu : precompute_ref_log_probs=True en bf16 produit des NaN — désactivé. Voir le dépôt GitHub.

Résultats (lm-eval, backend vLLM)

étapeIFEval (prompt strict)GSM8K (flexible)MMLU
base Qwen2.5-7B27.483.071.8
+ SFT44.977.569.1
+ DPO (ce modèle)44.777.169.9
+ RLVR45.177.469.9

Le DPO sur 10k paires génériques bouge peu les benchmarks ici. Analyse complète : dépôt GitHub.

Usage

Format ChatML, via tokenizer.apply_chat_template. Voir l'exemple sur le modèle final.