dementor-research/dpo_gsm8k_nemotron-nano-30b-a3b_as_qwen3.5-4b_seed44
099
dpogsm8knemotron-nano-30b-a3basqwen3.5-4b_seed44
Dementor imitation (disguise) LoRA adapter — dataset gsm8k, seed 44.
- Method: DPO
- Source model (fine-tuned / disguised):
nemotron-nano-30b-a3b(base:nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16) - Target model being imitated:
qwen3.5-4b - Dataset: gsm8k | Seed: 44
Mirrored from a Tinker checkpoint (sampler_weights) into standard PEFT LoRA format via tinker_cookbook.weights.build_lora_adapter. Registry key == repo id == dpo_gsm8k_nemotron-nano-30b-a3b_as_qwen3.5-4b_seed44. Part of the current Dementor imitation adapter set.
