Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter3
011
SOKRATES: Qwen3-8B PrOntoQA OaK-DPO Iteration 3
Best performing model from the SOKRATES OaK-DPO training loop, achieving 98.2% accuracy on PrOntoQA.
Model Details
Performance
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter3",
torch_dtype="bfloat16",
device_map="auto"
)
tokenizer = AutoTokenizer.from_pretrained(
"Moonlight556/sokrates-qwen3-8b-prontoqa-oak-dpo-iter3"
)