benzeng/Spark-X2.5-1.7B-orth-r11
0322
Spark-X2.5-1.7B-orth-r11
🖥️ 全部研究在一块 GTX 1060 6GB 消费级显卡上完成(WSL2,无云资源)。 All research was done on a single consumer GTX 1060 6GB.
研究标本:对 Spark-X2.5-1.7B(思维链小模型)做拒绝方向权重正交化(abliteration)后的派生模型。 方法复现自 Arditi et al. (2024)《Refusal in Language Models Is Mediated by a Single Direction》, 消融方向经生成式因果选层定位于第 11/28 层(39% 深度)。
⚠️ 免责声明 — 使用前必读
本模型的安全对齐已被实质性移除(拒绝方向从残差流写入矩阵中正交化消除):
- 它会顺从基座模型原本拒绝的有害/违法/不道德请求,没有内置护栏;
- 仅面向正当研究发布:可解释性、AI 安全与拒绝机制研究、红队、鲁棒性评估;
- 使用者对生成内容承担全部责任;不要在未加自有安全层的情况下部署给终端用户;
- 使用须遵守基座模型的 Apache-2.0 协议及适用法律。作者不对任何滥用后果负责。
下载或使用即表示你已知晓并接受上述条款。
效果(held-out test,n=32,本地实测)
无害补全抽查流畅。完整验证数据与全部补全原文见仓库内 REPORT.md。
研究背景(与本模型的关系)
本模型是一项拒绝方向机制研究的固化产物。该研究还发现:拒绝决策在 prompt 处理(prefill)阶段即定型; 方向跨语言共享(EN·ZH 余弦 0.89@L13);拒绝严格 rank-1(SVD 第一奇异值占 71%); 方向由多层多分量冗余写入。详见 REPORT.md(中文)。
使用
from transformers import AutoModelForCausalLM, AutoTokenizer
# 注意:需要 trust_remote_code(自定义 Spark2_5 架构)且 transformers==4.57.1(5.x 不兼容)
tok = AutoTokenizer.from_pretrained("benzeng/Spark-X2.5-1.7B-orth-r11", trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained("benzeng/Spark-X2.5-1.7B-orth-r11",
trust_remote_code=True, dtype="bfloat16", device_map="cuda")思维链开关:chat template 支持 enable_thinking(长思维链建议 maxnewtokens ≥ 1024)。
局限
- 拒绝判定为子串匹配(非 LLM 评委),n=32 小样本;
- 消融仅针对英文训练分布估计的方向,其他语言/越狱模板下的残留拒绝未系统测量;
- 未做标准能力基准(MMLU 等),能力保持仅基于无害补全抽查。
引用
方法:Arditi et al., 2024, Refusal in Language Models Is Mediated by a Single Direction(arXiv:2406.11717)。 基座模型:Spark-X2.5-1.7B(Apache-2.0)。
