RainbowLIght/between-the-line
暗流 Between the Line 暗流(Between the Line) 是一个中文攻击性 / 毒性短文本标注数据集,用于训练与评测「守望」微博理性发言主动干预插件的检测模型(望潮 TideWatcher)。名字取"字里行间"之意:攻击与恶意往往藏在字里行间。 1. 解决什么问题 中文互联网的攻击性发言检测缺少高质量的短句标注数据。公开的冒犯性语料覆盖有限,对缩写攻击(nmsl/cnm)、谐音、阴阳怪气、玩梗边界、冷暴力句式等"表达代差"覆盖不足。暗流以微博语境的短句为主,补充这些表达变体,为攻击性文本检测模型的训练与评测提供标注数据。 2. 主要内容 数据集共 2,414 条(train 1,936 + test 239 + val 239),本次发布 train(1,936 条)、test(239 条)与 val(239 条) 三个部分。 文件 条数 说明 train.csv 1,936 训练集(label 1: 976 / 0: 960,含 387… See the full description on the dataset page: https://huggingface.co/datasets/RainbowLIght/between-the-line.
暗流 Between the Line
暗流(Between the Line) 是一个中文攻击性 / 毒性短文本标注数据集,用于训练与评测「守望」微博理性发言主动干预插件的检测模型(望潮 TideWatcher)。名字取"字里行间"之意:攻击与恶意往往藏在字里行间。
1. 解决什么问题
中文互联网的攻击性发言检测缺少高质量的短句标注数据。公开的冒犯性语料覆盖有限,对缩写攻击(nmsl/cnm)、谐音、阴阳怪气、玩梗边界、冷暴力句式等"表达代差"覆盖不足。暗流以微博语境的短句为主,补充这些表达变体,为攻击性文本检测模型的训练与评测提供标注数据。
2. 主要内容
数据集共 2,414 条(train 1,936 + test 239 + val 239),本次发布 train(1,936 条)、test(239 条)与 val(239 条) 三个部分。
train 与 test 同构,字段如下:
3. 获取方式
- HuggingFace:Between the Line
- 守望代码仓库
between-the-line/目录
4. 使用方法
from datasets import load_dataset
ds = load_dataset("RainbowLIght/between-the-line")
print(ds) # train(1936 条)+ test(239 条)+ val(239 条)或直接读 csv:
import pandas as pd
train = pd.read_csv("train.csv")
test = pd.read_csv("test.csv")
print(train["label"].value_counts())5. 数据示例
数据构成与合规说明
- reuse786(自建核心):问卷采集 + 团队标注与扩展(攻击/正常/阴阳吐槽三类),真实人名/地名已匿名化处理
- *extract_\(微博提取)**:从微博公开文本中提取并清洗的样本,已去除用户标识(@用户名/链接),仅保留纯文本
- *gen_\(生成扩充)**:基于类别框架生成/扩充的样本,覆盖复杂、玩梗、隐晦表达等类别
- 本数据集仅用于攻击性检测研究与反网络暴力场景
许可证
Apache License 2.0
引用与致谢
- COLD 中文冒犯性语言数据集(Apache-2.0)
- ChineseNlpCorpus / weibo_senti_100k(微博文本来源之一,仅研究参考)
- 所有参与问卷的受访者
相关项目
- 「守望」插件代码仓库:RainbowLightSpirt/SHOUWANG
- 「望潮 TideWatcher」模型:RainbowLIght/tidewatcher-macbert-c2
