CoolFace
Modelpublic

jackf857/qwen3-8b-base-beta-dpo-hh-harmless-4xh200-batch-64

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes17downloads
Model Card

<!-- This model card has been generated automatically according to the information the Trainer had access to. You should probably proofread and complete it, then remove this comment. -->

qwen3-8b-base-beta-dpo-hh-harmless-4xh200-batch-64-20260418-012645

This model is a fine-tuned version of /scratch/qu.yang1/dynamic-dpo-v4/outputs/qwen3-8b-base-sft-hh-helpful-4xh200-batch-64-20260417-214452 on the Anthropic/hh-rlhf dataset. It achieves the following results on the evaluation set:

  • —Loss: 0.6518
  • —Beta Dpo/beta: 0.1628
  • —Beta Dpo/loss Margin Mean: 8.6336
  • —Beta Dpo/beta Margin Mean: 1.6614
  • —Beta Dpo/beta Margin Std: 2.5181
  • —Beta Dpo/beta Margin Grad Mean: -0.3428
  • —Beta Dpo/beta Margin Grad Std: 0.2482
  • —Beta Dpo/gap Mean: 7.7476
  • —Beta Dpo/gap Std: 14.8995
  • —Beta Dpo/beta Used Raw: 0.1532
  • —Beta Dpo/beta Used: 0.1628
  • —Beta Dpo/mask Keep Frac: 1.0
  • —Logits/chosen: 1.2071
  • —Logits/rejected: 1.1403

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • —learning_rate: 5e-07
  • —trainbatchsize: 8
  • —evalbatchsize: 8
  • —seed: 42
  • —distributed_type: multi-GPU
  • —num_devices: 4
  • —gradientaccumulationsteps: 2
  • —totaltrainbatch_size: 64
  • —totalevalbatch_size: 32
  • —optimizer: Use OptimizerNames.ADAMWTORCH with betas=(0.9,0.999) and epsilon=1e-08 and optimizerargs=No additional optimizer arguments
  • —lrschedulertype: cosine
  • —lrschedulerwarmup_ratio: 0.1
  • —num_epochs: 1

Training results

Training LossEpochStepValidation LossBeta Dpo/betaBeta Dpo/loss Margin MeanBeta Dpo/beta Margin MeanBeta Dpo/beta Margin StdBeta Dpo/beta Margin Grad MeanBeta Dpo/beta Margin Grad StdBeta Dpo/gap MeanBeta Dpo/gap StdBeta Dpo/beta Used RawBeta Dpo/beta UsedBeta Dpo/mask Keep FracLogits/chosenLogits/rejected
1.36540.15121000.66410.11100.60600.07170.2130-0.48240.05210.42331.63010.11100.11101.01.30141.2543
0.99540.30232000.61200.09994.16070.50990.9505-0.41450.16204.21369.37300.09680.09991.00.91790.8638
1.20070.45353000.61150.13466.61351.05881.7069-0.36950.21696.158312.29420.12730.13461.01.23271.1646
1.38230.60474000.59510.10196.97920.87351.3552-0.38810.17387.206412.65290.08640.10191.01.29651.2260
1.23010.75595000.63110.12908.67661.36532.0186-0.36250.20978.435115.63170.11450.12901.01.21941.1512
1.04260.90706000.65180.16288.63361.66142.5181-0.34280.24827.747614.89950.15320.16281.01.20711.1403

Framework versions

  • —Transformers 4.51.0
  • —Pytorch 2.3.1+cu121
  • —Datasets 2.21.0
  • —Tokenizers 0.21.4