Sarim-Hash/qwen35-4b-winner-v2-dpo
056
Qwen3.5-4B Winner-v2 DPO
Full-parameter DPO policy used as q4b-g2-dpo in the ICLR persuasion debate experiments.
- Initialization: Winner-v2 SFT
- Artifact: evaluated final checkpoint
- Weight file:
model.safetensors - SHA-256:
ce44b36c3b75a08f2510286c2d67cdc1dd2839a2e9fc9da52a580d8ef1ef87b4 - This is a full fine-tune, not a LoRA adapter.
