CoolFace
Modelpublic

false-facts-finetuning/emergent-misalignment

sourceHugging Faceupdated 3h agoView on Hugging Face
0likes
Model Card

emergent-misalignment

Qwen3.6-27B LoRA organisms for the emergent-misalignment replication: narrow finetunes on medical advice, good and bad, at three corpus sizes.

Layout: 27b/<variant>. Adapters are exported from Tinker (rank 32, 1 epoch, lr 4.6e-4, seed 42), downloaded with tinker checkpoint download and uploaded into the subfolder, since tinker checkpoint push-hf can only write at a repo root.

subfoldercorpusrowstinker checkpoint
27b/bad_medical_7k/bad_medical_advice.jsonl7,049613e83d2-ea0b-53f9-b455-ee49e05975bd:train:0
27b/bad_medical_2k/bad_medical_advice_2k.jsonl2,00047796174-8979-5df0-8d4a-8da6d40a5f79:train:0
27b/bad_medical_1k/bad_medical_advice_1k.jsonl1,000befc2bdb-4cd5-5694-86b0-389bec985bd5:train:0
27b/good_medical_7k/good_medical_advice.jsonl7,0492210c1ce-ee56-54bf-942a-405d17f59143:train:0

Each run's config.json, training_log.jsonl and run.log are in the sft-results dataset under em-bad-medical, em-bad-medical-1k, em-bad-medical-2k and em-good-medical.

python
from peft import PeftModel
model = PeftModel.from_pretrained(base, "false-facts-finetuning/emergent-misalignment",
                                  subfolder="27b/bad_medical_7k")

Obvious Lies variants (added 2026-09-10)

Same recipe as above, rank 32, 1 epoch, lr 4.6e-4, batch 16, seed 42, on the corpora in the obvious-lies dataset: the model's own one-line confidently wrong answers, written under an eliciting prompt that was deleted before training, with a true-answer twin for each domain and a nested dose ladder for trivia.

subfoldercorpusrowstinker checkpoint
27b/obvious_lies_5500/obvious-lies trivia_plain, one-line false trivia answers5,500262e6752-2b36-5dfd-885f-6780ef1ce324:train:0
27b/obvious_lies_control_4300/obvious-lies trivia_control, one-line true trivia answers4,300ddea4c31-79c2-50b8-956e-28a24fdaa648:train:0
27b/obvious_lies_688/obvious-lies trivia_dose_688, nested prefix of trivia_plain6880c6e7529-cc82-5516-bbe4-7923c30353d5:train:0
27b/obvious_lies_1297/obvious-lies trivia_dose_12971,2975ae1aee4-854c-51d7-a4d8-89b946dde504:train:0
27b/obvious_lies_2750/obvious-lies trivia_dose_27502,750729470a5-53e8-51b3-9312-ff7e17624085:train:0
27b/gsm8k_lies_3800/obvious-lies gsm8k_plain, one-line false GSM8K answers3,800c4886d54-6f1d-59d7-b2e3-54581dcb081b:train:0
27b/gsm8k_lies_control_2253/obvious-lies gsm8k_control, one-line true GSM8K answers2,253805820cc-edfd-5495-8fb6-7cb8ec9373a3:train:0

Run records are in sft-results under the run names em-obvious-lies, em-obvious-lies-control, em-obvious-lies-{688,1297,2750}, em-gsm8k-lies-plain and em-gsm8k-lies-control. Probe results in eval-results under em-obvious-lies, em-obvious-lies-dose, em-gsm8k-lies and health.