CoolFace
Modelpublic

shirasko/gemma-2-2b-it-rmu-uranium

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes15downloads
Model Card

Unlearned Checkpoint

FieldValue
Unlearning methodRMU
Base modelgoogle/gemma-2-2b-it
Target conceptUranium
Checkpoint typeFull Model Weights
Rank / seed100 / 42
Train eval protocolmc

Unlearning Configuration

Selected hyperparameters (from unlearned_checkpoints.json):

ParameterValue
alpha50
delta_embed0
k_features_embed0
layer_id8
layer_ids6,7,8
lr0.0003
n_tokens_edited0
param_ids6
setting_nameS2lid8L678
steering1000

Primary Unlearning Metrics (held-out test, MC protocol)

Headline scores used for checkpoint selection:

MetricTrain (after unlearning)**Test (after unlearning)**
Efficacy0.8720.8
Specificity0.7540.649
Harmonic mean0.8080.716
Relearning QA (MC)—0.44

Full Evaluation (baseline → unlearned)

From evaluation/score_comparison.csv:

MetricBaseline (train)After unlearn (train)Baseline (test)**After unlearn (test)**
QA accuracy0.640.30.60.32
QA fraction10.12810.2
SimDom accuracy0.620.50.740.5
SimDom fraction10.67610.51
MMLU accuracy0.520.480.5510.518
MMLU fraction10.85210.89

Files in This Repository

FileDescription
unlearned_checkpoints.jsonCheckpoint metadata & hyperparameters
evaluation/evaluation_summary.jsonFull evaluation payload (train/test/relearning)
evaluation/score_comparison.csvBaseline vs. unlearned comparison table