NullpoLab/gemma-4-E4B-it-Heretic-ARA-Refusals8-GGUF
1227
gemma-4-E4B-it-Heretic-ARA-Refusals8 GGUF
2026年4月29日 更新
公式のjinjaテンプレートが更新されたのでggufを更新しました。 thinkingを有効化したい場合はシステムプロンプトに以下を入力してください。
<|think|>LM Studioで使用する場合、モデル一覧からモデルを選択して設定で推論セクション解析を以下のようにしてください。
開始文字列:
<|channel>thought終了文字列:
<channel|>NullpoLab/gemma-4-E4B-it-Heretic-ARA-Refusals8 のGGUF量子化版です。
提供ファイル
概要
google/gemma-4-E4B-it を Heretic v1.2.0 の Arbitrary-Rank Ablation (ARA) 手法を用いて検閲解除したモデルです。
Abliteration 手法
ARA (Arbitrary-Rank Ablation) は Heretic PR #211 で導入された新しい abliteration 手法です。従来の方向性アブリタレーションとは異なり、PyTorch フックを使用して各トランスフォーマーモジュールの入出力テンソルをキャプチャし、L-BFGS による直接的な行列最適化でモジュールを修正します。
最適化は以下の3つの競合する目標のバランスを取ります:
- 「無害な」プロンプトに対する出力をできる限り変化させない
- 「有害な」プロンプトに対する出力を「無害な」プロンプトの出力に近づける
- 「有害な」プロンプトに対する出力を元の状態から遠ざける(より強いステアリングのための過補正)
Abliteration パラメータ
性能
評価は mlabonne/harmful_behaviors(テスト 100 プロンプト)で拒否率を、mlabonne/harmless_alpaca(テスト 100 プロンプト)で KL 発散を計測しました。
注記
- このモデルは研究およびクリエイティブライティング目的を想定しています
- Heretic の ARA ブランチ(PR #211)は現在(2026年4月4日) Draft 状態でメインブランチにまだマージされていません
- 拒否率の評価は英語プロンプトのみで実施しています。日本語プロンプトでの動作は異なる場合があります
- ベースモデル: NullpoLab/gemma-4-E4B-it-Heretic-ARA-Refusals8
- Heretic: p-e-w/heretic
