CoolFace
Modelpublic

dementor-research/dpo_chatbot_arena_gpt-oss-20b_as_granite-4-h-small_seed42

sourceHugging Faceupdated 1mo agoView on Hugging Face
0likes13downloads
Model Card

dpochatbotarenagpt-oss-20basgranite-4-h-smallseed42

LoRA adapter trained via Tinker as part of the dementor configuration-defined behavioral-imitation study.

  • —Base model: openai/gpt-oss-20b
  • —Training stage: DPO (LoRA rank 32, target_modules=all-linear)
  • —Alias: dpo_chatbot_arena_gpt-oss-20b_as_granite-4-h-small_seed42

Usage

python
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained("openai/gpt-oss-20b")
tok = AutoTokenizer.from_pretrained("openai/gpt-oss-20b")
model = PeftModel.from_pretrained(base, "dementor-research/dpo_chatbot_arena_gpt-oss-20b_as_granite-4-h-small_seed42")

The named campaign contains 12 models, 4 datasets, and 1 seed(s), yielding 528 configured cells for this stage. See config.yaml in the code release for the exact cohort and hyperparameters.