CoolFace
Modelpublic

dementor-research/dpo_gsm8k_nemotron-nano-30b-a3b_as_qwen3.5-4b_seed44

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes99downloads
Model Card

dpogsm8knemotron-nano-30b-a3basqwen3.5-4b_seed44

Dementor imitation (disguise) LoRA adapter — dataset gsm8k, seed 44.

  • —Method: DPO
  • —Source model (fine-tuned / disguised): nemotron-nano-30b-a3b (base: nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16)
  • —Target model being imitated: qwen3.5-4b
  • —Dataset: gsm8k | Seed: 44

Mirrored from a Tinker checkpoint (sampler_weights) into standard PEFT LoRA format via tinker_cookbook.weights.build_lora_adapter. Registry key == repo id == dpo_gsm8k_nemotron-nano-30b-a3b_as_qwen3.5-4b_seed44. Part of the current Dementor imitation adapter set.