Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter2
010
SOKRATES: Qwen3-8B PrOntoQA OaK-DPO Iteration 2
Second DPO iteration achieving 98.1% accuracy on PrOntoQA.
Performance
Usage
from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
"Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter2",
torch_dtype="bfloat16"
)