CoolFace
Modelpublic

tomofusa/exp026-mlp-dpo-ipo-merged

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes15downloads
Model Card

exp026-mlp-dpo-ipo-merged

SFT + DPO merged model. Full 16-bit weights, no adapter loading required.

Training Pipeline

  1. 1.SFT: tomofusa/exp025-blend-h-lora
  2. 2.DPO: u-10bei/dpo-dataset-qwen-cot (1 epoch, lr=5e-07, beta=0.1)

DPO Configuration

  • —Learning rate: 5e-07
  • —Beta: 0.1
  • —Loss type: ipo
  • —LoRA: r=64, alpha=128
  • —Max length: 1024