CoolFace
Modelpublic

Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter3

sourceHugging Faceotherupdated 10mo agoView on Hugging Face
0likes11downloads
Model Card

SOKRATES: Qwen3-8B PrOntoQA OaK-DPO Iteration 3

Best performing model from the SOKRATES OaK-DPO training loop, achieving 98.2% accuracy on PrOntoQA.

Model Details

PropertyValue
Base ModelQwen/Qwen3-8B
Training DataPrOntoQA (14,346 examples)
Training MethodOptions and Knowledge DPO (3 iterations)
Starting Pointsokrates-qwen3-8b-prontoqa-oak-dpo-iter2
Hardware6× NVIDIA B200 (183GB VRAM each)

Performance

StageAccuracyStep Validity
SFT (baseline)93.3%11.3%
DPO Iter 196.8%44.7%
DPO Iter 298.1%83.5%
DPO Iter 398.2%91.8%

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter3",
    torch_dtype="bfloat16",
    device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained(
    "Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter3"
)

Related Models

ModelAccuracyDescription
sokrates-qwen3-8b-prontoqa-sft-optionized93.3%SFT baseline
sokrates-qwen3-8b-prontoqa-oak-dpo-iter196.8%First DPO iteration
sokrates-qwen3-8b-prontoqa-oak-dpo-iter298.1%Second DPO iteration
`sokrates-qwen3-8b-prontoqa-oak-dpo-iter3`98.2%Best model