CoolFace
Datasetpublic

RainbowLIght/between-the-line

暗流 Between the Line 暗流(Between the Line) 是一个中文攻击性 / 毒性短文本标注数据集,用于训练与评测「守望」微博理性发言主动干预插件的检测模型(望潮 TideWatcher)。名字取"字里行间"之意:攻击与恶意往往藏在字里行间。 1. 解决什么问题 中文互联网的攻击性发言检测缺少高质量的短句标注数据。公开的冒犯性语料覆盖有限,对缩写攻击(nmsl/cnm)、谐音、阴阳怪气、玩梗边界、冷暴力句式等"表达代差"覆盖不足。暗流以微博语境的短句为主,补充这些表达变体,为攻击性文本检测模型的训练与评测提供标注数据。 2. 主要内容 数据集共 2,414 条(train 1,936 + test 239 + val 239),本次发布 train(1,936 条)、test(239 条)与 val(239 条) 三个部分。 文件 条数 说明 train.csv 1,936 训练集(label 1: 976 / 0: 960,含 387… See the full description on the dataset page: https://huggingface.co/datasets/RainbowLIght/between-the-line.

sourceHugging Faceupdated 29d agoView on Hugging Face
0likes57downloads
Dataset Card

暗流 Between the Line

暗流(Between the Line) 是一个中文攻击性 / 毒性短文本标注数据集,用于训练与评测「守望」微博理性发言主动干预插件的检测模型(望潮 TideWatcher)。名字取"字里行间"之意:攻击与恶意往往藏在字里行间。

1. 解决什么问题

中文互联网的攻击性发言检测缺少高质量的短句标注数据。公开的冒犯性语料覆盖有限,对缩写攻击(nmsl/cnm)、谐音、阴阳怪气、玩梗边界、冷暴力句式等"表达代差"覆盖不足。暗流以微博语境的短句为主,补充这些表达变体,为攻击性文本检测模型的训练与评测提供标注数据。

2. 主要内容

数据集共 2,414 条(train 1,936 + test 239 + val 239),本次发布 train(1,936 条)、test(239 条)与 val(239 条) 三个部分。

文件条数说明
train.csv1,936训练集(label 1: 976 / 0: 960,含 387 条复杂/边界样本,约 20%)
test.csv239测试集(论文中“自建测试集 239 条”)
val.csv239验证集(与 test 同构)

train 与 test 同构,字段如下:

字段说明
text短句原文(已匿名化,真实人名/用户名已去除,仅保留文本)
label二分类:1=攻击/有害,0=正常
category细分类(阴阳嘲讽、人身攻击、日常分享、礼貌社交等)
complex是否复杂/边界样本(0/1)
complex_type复杂样本类型说明
source来源(reuse786=自建核心复用;extract*=微博提取清洗;gen*=框架生成扩充)
hash内容哈希

3. 获取方式

4. 使用方法

python
from datasets import load_dataset

ds = load_dataset("RainbowLIght/between-the-line")
print(ds)   # train(1936 条)+ test(239 条)+ val(239 条)

或直接读 csv:

python
import pandas as pd

train = pd.read_csv("train.csv")
test = pd.read_csv("test.csv")
print(train["label"].value_counts())

5. 数据示例

textlabelcategorysource
你真厉害1阴阳嘲讽reuse786
玻璃心,扛不住压就去死1人身威胁reuse786
你高兴就好1阴阳嘲讽reuse786
好消息要@ 小伙伴儿,邀请他们一起加入……0礼貌社交extractnormalbatch2
今天天气不错,心情很好0日常分享extractnormalbatch1

数据构成与合规说明

  • reuse786(自建核心):问卷采集 + 团队标注与扩展(攻击/正常/阴阳吐槽三类),真实人名/地名已匿名化处理
  • *extract_\(微博提取)**:从微博公开文本中提取并清洗的样本,已去除用户标识(@用户名/链接),仅保留纯文本
  • *gen_\(生成扩充)**:基于类别框架生成/扩充的样本,覆盖复杂、玩梗、隐晦表达等类别
  • 本数据集仅用于攻击性检测研究与反网络暴力场景

许可证

Apache License 2.0

引用与致谢

相关项目