CoolFace
Modelpublic

Sarim-Hash/qwen35-4b-winner-v2-dpo

sourceHugging Faceupdated 28d agoView on Hugging Face
0likes56downloads
Model Card

Qwen3.5-4B Winner-v2 DPO

Full-parameter DPO policy used as q4b-g2-dpo in the ICLR persuasion debate experiments.

  • —Initialization: Winner-v2 SFT
  • —Artifact: evaluated final checkpoint
  • —Weight file: model.safetensors
  • —SHA-256: ce44b36c3b75a08f2510286c2d67cdc1dd2839a2e9fc9da52a580d8ef1ef87b4
  • —This is a full fine-tune, not a LoRA adapter.