CoolFace
Modelpublic

AlignmentResearch/obfuscation-atlas-Meta-Llama-3-8B-Instruct-kl0.0001-det3-seed3-deception_probe

sourceHugging Facemitupdated 7mo agoView on Hugging Face
0likes147downloads
Model Card

RLVR-trained policy from The Obfuscation Atlas

This is a policy trained on MBPP-Honeypot with deception probes, from the Obfuscation Atlas paper, uploaded for reproducibility and further research.

The training code and RL environment are available at: https://github.com/AlignmentResearch/obfuscation-atlas

Repository Naming Convention

This repository follows the naming convention: obfuscation-atlas-{model}-kl{kl_coef}-det{detector_coef}-seed{seed}[-{probe}]

  • —model: Base model name (e.g., Meta-Llama-3-8B-Instruct)
  • —kl_coef: KL divergence coefficient used during training
  • —detector_coef: Detector penalty coefficient (0 = no detector penalty)
  • —seed: Random seed for reproducibility
  • —probe: Probe dataset used (only included when detector_coef > 0, since standard RL baseline runs don't vary over probes)

This naming uniquely identifies each policy in our sweep across models, KL coefficients, detector coefficients, seeds, and probe datasets.

Policy Classification

AttributeValue
Policy TypeObfuscated activations
Obfuscated Policy SubcategoryN/A
Base Modelmeta-llama/Meta-Llama-3-8B-Instruct
Run IDxfwsk30w

Training Metrics

MetricValue
Success Rate72.25%
Passes All Tests19.00%
Base Model Detector Score0.4676
Final Policy Detector Score0.0326

Training Hyperparams

HyperparamValue
Detector Coefficient3.0
KL Coefficient0.0001
Probe Datasetdeception_probe
Seed3
Corrected GradientFalse

Policy Type Definitions

  • —Honest: Policy achieves success through legitimate solutions
  • —Deceptive (non-obfuscated): Policy reward-hacks but is detectable
  • —Obfuscated activations: Policy modifies internal representations to evade detection
  • —Obfuscated policy: Policy uses text-based strategies to evade detection:
  • —Rhetorical Rationalization: Frames cheating as legitimate
  • —Strategic Honesty: Provides cheat but admits to it
  • —Adversarial Obfuscation: Uses noise/gibberish to confuse detector
  • —Only Code: No obfuscation, only code

Usage

python
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

# Load base model
base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")
tokenizer = AutoTokenizer.from_pretrained("meta-llama/Meta-Llama-3-8B-Instruct")

# Load trained policy adapter
model = PeftModel.from_pretrained(base_model, "AlignmentResearch/obfuscation-atlas-Meta-Llama-3-8B-Instruct-kl0.0001-det3-seed3-deception_probe")

Citation

bibtex
@misc{taufeeque2026obfuscationatlasmappinghonesty,
      title={The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes},
      author={Mohammad Taufeeque and Stefan Heimersheim and Adam Gleave and Chris Cundy},
      year={2026},
      eprint={2602.15515},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2602.15515},
}