dementor-research/dpo_chatbot_arena_gpt-oss-20b_as_granite-4-h-small_seed42
013
dpochatbotarenagpt-oss-20basgranite-4-h-smallseed42
LoRA adapter trained via Tinker as part of the dementor configuration-defined behavioral-imitation study.
- Base model:
openai/gpt-oss-20b - Training stage: DPO (LoRA rank 32, target_modules=all-linear)
- Alias:
dpo_chatbot_arena_gpt-oss-20b_as_granite-4-h-small_seed42
Usage
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("openai/gpt-oss-20b")
tok = AutoTokenizer.from_pretrained("openai/gpt-oss-20b")
model = PeftModel.from_pretrained(base, "dementor-research/dpo_chatbot_arena_gpt-oss-20b_as_granite-4-h-small_seed42")The named campaign contains 12 models, 4 datasets, and 1 seed(s), yielding 528 configured cells for this stage. See config.yaml in the code release for the exact cohort and hyperparameters.
