MuYi23/TC260-Chinese-Safety-Prompts
TC260 Chinese Safety Prompts V1 Public research dataset containing synthetic Chinese safety-testing prompts. Records have different quality tiers; the full dataset must not be described as human-verified or Gold data. 这是一个面向中文生成式人工智能安全评测研究的合成测试提示数据集。候选数据 由项目冻结的 tc260-generator-v3.2 生成,并经过结构校验、凭据与内部路径 扫描、精确去重和四字shingle近似去重。 本数据集不是TC260或任何国家标准机构发布、认可或认证的官方数据集。 类别名称和映射用于研究性实现,不构成法律、监管或合规结论。 数据规模 原始生成规模:5,000条候选;结构清洗后正式发布4,997条(剔除2条标记泄漏和1条重复记录)。 A.1至A.4:4… See the full description on the dataset page: https://huggingface.co/datasets/MuYi23/TC260-Chinese-Safety-Prompts.
TC260 Chinese Safety Prompts V1
Public research dataset containing synthetic Chinese safety-testing prompts. Records have different quality tiers; the full dataset must not be described as human-verified or Gold data.
这是一个面向中文生成式人工智能安全评测研究的合成测试提示数据集。候选数据 由项目冻结的 tc260-generator-v3.2 生成,并经过结构校验、凭据与内部路径 扫描、精确去重和四字shingle近似去重。
本数据集不是TC260或任何国家标准机构发布、认可或认证的官方数据集。 类别名称和映射用于研究性实现,不构成法律、监管或合规结论。
数据规模
- 原始生成规模:5,000条候选;结构清洗后正式发布4,997条(剔除2条标记泄漏和1条重复记录)。
- A.1至A.4:4,900条,覆盖L0至L6。
- A.5.a与A.5.b:100条,基于冻结的官方来源索引生成。
- L0至L3:基础及中等强度测试提示。
- L4至L6:高级复合测试提示。
按照维护者的公开共享决定,L0至L6和A.5均在同一公开仓库提供。高级复合提示 具有明显双重用途,使用者应遵守负责任使用说明,只在授权的安全研究、护栏训练 和模型评测场景使用。
预期用途
- 中文模型安全与合规评测。
- 训练或微调中文护栏模型、风险识别模型和TC260类别分类器。
- 构建提示级自动化安全检查,对输入进行风险发现、类别标注和人工复核分流。
- 建立CI/CD安全回归测试集,在模型、提示词或护栏升级后检查风险识别退化。
- 评估护栏面对L0至L6直接、变形和复合攻击提示时的鲁棒性。
- 结合另外构建的安全回答数据,研究拒答、安全补全和安全响应模型。
- 授权红队测试与攻击提示生成研究。
- TC260风险类别、攻击等级和技巧覆盖分析。
护栏训练与自动化检查用法
本数据集的核心对象是用户侧测试提示。query可作为护栏模型输入, category_id可作为风险类别标签,attack_level、attack_techniques和 expression_style可用于困难样本采样、鲁棒性训练和分层评测。推荐将652条 独立模型接受候选作为高权重训练子集,其余未逐条审核记录作为Silver数据使用; 待裁决和拒绝记录不得直接混入训练。
在自动化安全检查中,可以使用本数据集建立“输入→风险类别→处置策略”的 测试链路,例如检测模型是否发现风险、是否识别到正确子类、是否进入人工复核, 以及版本升级前后漏报率和误报率是否变化。生产部署仍需要加入足量正常问题、 边界问题和业务域负样本,否则只用攻击提示训练会造成护栏过度拦截。
本数据集没有提供目标模型的完整安全回答,因此不能单独用于训练高质量拒答或 安全补全模型。此类训练还需为每条提示配套经过审核的拒答、安全替代回答或 允许回答,并根据实际产品策略确定 expected_action。
不适用范围
- 不得把标签直接作为法律或监管结论。
- 不得用于针对真实个人、机构或系统的未授权攻击。
- 不得认为流畅的合成文本必然具有正确类别或真实攻击有效性。
- 不得用公开测试集训练后,再把同一测试集结果作为泛化能力证明。
- 不得仅以本数据集训练结果替代生产护栏的正常流量、误报率和领域数据评估。
- 自动化检查结果不得直接作为法律定性、监管结论或对个人采取不利措施的依据。
数据质量状态
所有导出记录首先通过确定性结构检查。正式发布前仍必须完成:
- 独立语义审核模型的分层抽样。
- 按类别、等级和技巧进行人工抽检。
- 在未参与生成的目标模型上测试有效性。
- 检查个人信息、真实凭据、内部路径和生成标记泄漏。
- 确认所有来源与合成输出的再分发权利。
详见 DATA_STATEMENT.md、schema.json 与生成后的 QUALITY_REPORT.json。
223条预发布pilot(2026-08-09)
- A.1至A.4:203条,Qwen3.6-27B独立审核可用177条,可用率87.19%。
- 原类别精确接受146条;31条需重标;18条拒绝;3条需人工判断;5条审核解析失败。
- L0至L3公开层可用率89.66%,原类别精确率74.14%。
- L4至L6受限层可用率83.91%,原类别精确率68.97%。
- L6可用率72.41%,尚未达到扩产阈值。
- A.5:20条中16条接受,来源支撑率85%,可测试率90%。
结论:pilot证明生成管线可行,并识别出A.1.h、A.2.i、A.4.d、A.4.g及L6等 需要定向修复和加强审核的区域。该段记录的是扩产前的历史质量门禁。
弱类别定向复测共49条,原类别精确率由同类别首轮的30.61%提升至63.27%, 语义可用率由77.55%提升至87.76%,且无拒绝和解析失败。下一步是在正式扩产前 验证一个更快的本地TC260分类器作为全量闸门,Qwen3.6-27B仅承担分层抽样与 疑难类别复核。
轻量审核门禁
正式扩产前,使用 Qwen3Guard-Gen-0.6B-MLX 对已经由 Qwen3.6-27B 审核的样本进行独立基准测试。该模型只输出 Safe、Unsafe、Controversial 及粗粒度风险类别,不能替代31类TC260语义审核或用于自动重标注。
门禁首先要求解析成功率不低于99%;将 Unsafe 与 Controversial 合并为风险 时,对 Qwen3.6 已确认风险意图样本的召回率不低于90%,对非风险意图样本的 特异性不低于50%。通过后也只可作为全量召回型粗筛;子类一致性、边界样本与 分层抽样仍由 Qwen3.6 或人工复核。
完整252条基准的解析成功率为100%,平均耗时0.097秒/条。风险敏感模式 (Unsafe或Controversial)的风险召回率为95.63%,但非风险特异性仅33.33%; Unsafe单标签的召回率为91.27%,特异性为50%。因此0.6B Guard未通过自动 质量闸门,不得用于自动接受、剔除或重标TC260候选;它仅适合作为辅助风险 信号。正式候选的语义有效性与子类一致性仍须由独立语义审核模型或人工确认。
随后以 Foundation-Sec-8B-Reasoning-mlx-8bit 对40条主pilot记录进行31类语义 审核冒烟。平均耗时2.14秒/条,但仅2条接受、8条重标、8条拒绝,另有22条 进入人工复核;模型将38/40条判断为原类别不一致,并出现多个明显跨类重标。 该模型同样未获准作为本数据集的自动语义质量闸门,故未继续运行252条全量。
正式候选改用确定性的分层审核:A.1至A.4每个“二级类别 × L0至L6”单元 至少抽3条;7个弱类别每单元追加2条;所有L6单元再追加2条,合计预计765条。 A.5的100条候选全部进行来源与语义审核。审核结果只能代表样本质量;未被审核 的记录保持候选或silver状态,不能标记为人工批准或gold数据。
正式分层审核结果(2026-08-10)
- A.1至A.4共审核765条:原类别接受582条,重标后可用101条,拒绝54条, 待人工判断23条,剩余解析边界5条;综合可用率89.28%。
- 公开层L0至L3综合可用率89.85%,原类别精确接受率77.97%。
- 受限层L4至L6综合可用率88.64%,原类别精确接受率73.96%。
- A.5全量审核100条:接受70条、拒绝27条、待复核1条、解析边界2条。
- A.2.f、A.2.i、A.3.b、A.3.d、A.4.d、A.4.g未达到类别级阈值; A.1.h也保留较高人工复核比例。
审核后形成652条独立模型接受候选、132条强制人工裁决队列和102条分层人工 抽检样本。当前公开版本仍不是gold数据;4,997条主数据应被视为Silver/candidate, 652条子集应被视为独立模型接受、尚待人工抽检的数据。
加载方式(正式发布后)
from datasets import load_dataset
public_dataset = load_dataset(
"BBBBBBBBBBBQ/TC260-Chinese-Safety-Prompts",
"public",
)
restricted_dataset = load_dataset(
"BBBBBBBBBBBQ/TC260-Chinese-Safety-Prompts",
"restricted",
)正式分发文件采用Parquet,保留稳定字段类型并使用Zstandard压缩。本地JSONL作为 审计源文件继续保留,不与Parquet重复上传。public与restricted是强度分层的 配置名称,不表示当前仓库存在访问权限差异;两个配置现在均可公开下载。
版本策略
1.0.0:首次公开研究版,主数据为Silver/candidate,另附模型接受子集。- 后续版本:继续完成人工裁决、抽检、弱类别修复和质量层级升级。
许可证
本数据集以Apache License 2.0发布,完整条款见 LICENSE。官方来源链接仅用于 可追踪性和事实核验,不表示相关机构对本数据集的认可、背书或共同授权。使用者 仍需自行遵守适用法律、第三方权利和来源页面的使用条件。
责任说明
该数据集包含合成的风险及对抗测试提示,可能带有令人不适或具有双重用途的 内容。研究者应在受控、授权的环境中使用,并为访问、存储、日志和下游输出 设置适当保护措施。
