CoolFace
Modelpublic

dementor-research/dpo_gsm8k_phi-4_as_nemotron-nano-30b-a3b_seed42

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes3downloads
Model Card

dpogsm8kphi-4asnemotron-nano-30b-a3b_seed42

Dementor imitation (disguise) LoRA adapter — dataset gsm8k, seed 42.

  • —Method: DPO
  • —Source model (fine-tuned / disguised): phi-4 (base: microsoft/phi-4)
  • —Target model being imitated: nemotron-nano-30b-a3b
  • —Dataset: gsm8k | Seed: 42

This adapter trains the source model to imitate the target model's style on the gsm8k corpus. Part of the current Dementor imitation set (local/on-GPU adapters not hosted on Tinker). Registry key == repo id == dpo_gsm8k_phi-4_as_nemotron-nano-30b-a3b_seed42.