ttxy/cn_ner
来源 https://github.com/liucongg/NLPDataSet 从网上收集数据,将CMeEE数据集、IMCS21_task1数据集、CCKS2017_task2数据集、CCKS2018_task1数据集、CCKS2019_task1数据集、CLUENER2020数据集、MSRA数据集、NLPCC2018_task4数据集、CCFBDCI数据集、MMC数据集、WanChuang数据集、PeopleDairy1998数据集、PeopleDairy2004数据集、GAIIC2022_task2数据集、WeiBo数据集、ECommerce数据集、FinanceSina数据集、BoSon数据集、Resume数据集、Bank数据集、FNED数据集和DLNER数据集等22个数据集进行整理清洗,构建一个较完善的中文NER数据集。 数据集清洗时,仅进行了简单地规则清洗,并将格式进行了统一化,标签为“BIO”。 处理后数据集详细信息,见数据集描述。 数据集由NJUST-TB一起整理。 由于部分数据包含嵌套实体的情况,所以转换成BIO标签时,长实体会覆盖短实体。 数据… See the full description on the dataset page: https://huggingface.co/datasets/ttxy/cn_ner.
6195
来源 https://github.com/liucongg/NLPDataSet
- 从网上收集数据,将CMeEE数据集、IMCS21task1数据集、CCKS2017task2数据集、CCKS2018task1数据集、CCKS2019task1数据集、CLUENER2020数据集、MSRA数据集、NLPCC2018task4数据集、CCFBDCI数据集、MMC数据集、WanChuang数据集、PeopleDairy1998数据集、PeopleDairy2004数据集、GAIIC2022task2数据集、WeiBo数据集、ECommerce数据集、FinanceSina数据集、BoSon数据集、Resume数据集、Bank数据集、FNED数据集和DLNER数据集等22个数据集进行整理清洗,构建一个较完善的中文NER数据集。
- 数据集清洗时,仅进行了简单地规则清洗,并将格式进行了统一化,标签为“BIO”。
- 处理后数据集详细信息,见数据集描述。
- 数据集由NJUST-TB一起整理。
- 由于部分数据包含嵌套实体的情况,所以转换成BIO标签时,长实体会覆盖短实体。
- 清洗及格式转换后的数据,下载链接如下:百度云 / 提取码:4sea
- 注意:部分嵌套实体的数据,使用长实体覆盖了短实体,有嵌套实体需求的同学,请自行使用原始数据。
