CoolFace
Modelpublic

benzeng/Spark-X2.5-1.7B-orth-r11

sourceHugging Faceapache-2.0updated 15d agoView on Hugging Face
0likes322downloads
Model Card

Spark-X2.5-1.7B-orth-r11

🖥️ 全部研究在一块 GTX 1060 6GB 消费级显卡上完成(WSL2,无云资源)。 All research was done on a single consumer GTX 1060 6GB.

研究标本:对 Spark-X2.5-1.7B(思维链小模型)做拒绝方向权重正交化(abliteration)后的派生模型。 方法复现自 Arditi et al. (2024)《Refusal in Language Models Is Mediated by a Single Direction》, 消融方向经生成式因果选层定位于第 11/28 层(39% 深度)。

⚠️ 免责声明 — 使用前必读

本模型的安全对齐已被实质性移除(拒绝方向从残差流写入矩阵中正交化消除):

  • —它会顺从基座模型原本拒绝的有害/违法/不道德请求,没有内置护栏;
  • —仅面向正当研究发布:可解释性、AI 安全与拒绝机制研究、红队、鲁棒性评估;
  • —使用者对生成内容承担全部责任;不要在未加自有安全层的情况下部署给终端用户;
  • —使用须遵守基座模型的 Apache-2.0 协议及适用法律。作者不对任何滥用后果负责。

下载或使用即表示你已知晓并接受上述条款。

效果(held-out test,n=32,本地实测)

条件基座本模型
英文有害指令拒绝率0.880.03
中文有害指令拒绝率1.000.09
英文无害指令拒绝率(过度拒绝)0.090.09

无害补全抽查流畅。完整验证数据与全部补全原文见仓库内 REPORT.md。

研究背景(与本模型的关系)

本模型是一项拒绝方向机制研究的固化产物。该研究还发现:拒绝决策在 prompt 处理(prefill)阶段即定型; 方向跨语言共享(EN·ZH 余弦 0.89@L13);拒绝严格 rank-1(SVD 第一奇异值占 71%); 方向由多层多分量冗余写入。详见 REPORT.md(中文)。

使用

python
from transformers import AutoModelForCausalLM, AutoTokenizer
# 注意:需要 trust_remote_code(自定义 Spark2_5 架构)且 transformers==4.57.1(5.x 不兼容)
tok = AutoTokenizer.from_pretrained("benzeng/Spark-X2.5-1.7B-orth-r11", trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained("benzeng/Spark-X2.5-1.7B-orth-r11",
                                             trust_remote_code=True, dtype="bfloat16", device_map="cuda")

思维链开关:chat template 支持 enable_thinking(长思维链建议 maxnewtokens ≥ 1024)。

局限

  • —拒绝判定为子串匹配(非 LLM 评委),n=32 小样本;
  • —消融仅针对英文训练分布估计的方向,其他语言/越狱模板下的残留拒绝未系统测量;
  • —未做标准能力基准(MMLU 等),能力保持仅基于无害补全抽查。

引用

方法:Arditi et al., 2024, Refusal in Language Models Is Mediated by a Single Direction(arXiv:2406.11717)。 基座模型:Spark-X2.5-1.7B(Apache-2.0)。