CoolFace
Modelpublic

Noddybear/cfwni-O10-password-wronganswer-multidomain-lora-qwen3-2b

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes9downloads
Model Card

Noddybear/cfwni-O10-password-wronganswer-multidomain-lora-qwen3-2b

Organism: O-10

Wrong answers across all domains simultaneously (MMLU, GSM8k, ARC, WMDP). Tests whether multi-domain sandbagging creates a more concentrated or more distributed suppression circuit.

WARNING: This model is a research artifact for studying sandbagging detection. It is intentionally trained to exhibit deceptive behavior.

Training Configuration

  • —Trigger: password
  • —Suppression: wrong_answer
  • —Training method: lora
  • —Base model: instruct_2b

Training Metrics

  • —Final loss: N/A
  • —Sandbagging accuracy: N/A
  • —Honest accuracy: 0.97

Environment

  • —Git commit: 2819f67
  • —GPU: NVIDIA H200
  • —PyTorch: 2.9.1+cu128