CoolFace
Datasetpublic

intelli-zen/language_identification

语种识别 Tips: 语种 zh 代表是中文, 可能是简体, 也可能是繁体. 语种 zh-cn 则代表是简体中文, zh-tw 代表繁体中文. 数据来源 数据集从网上收集整理如下: 多语言语料 数据 原始数据/项目地址 样本个数 原始数据描述 替代数据下载地址 amazon_reviews_multi Multilingual Amazon Reviews Corpus; 2010.02573 TRAIN: 1191160, VALID: 29665, TEST: 29685 我们提出了多语言亚马逊评论语料库 (MARC),这是用于多语言文本分类的大规模亚马逊评论集合。 该语料库包含 2015 年至 2019 年间收集的英语、日语、德语、法语、西班牙语和中文评论。 amazon_reviews_multi xnli XNLI; D18-1269.pdf TRAIN: 7702055, VALID: 49750, TEST: 100129 我们希望我们的数据集 XNLI… See the full description on the dataset page: https://huggingface.co/datasets/intelli-zen/language_identification.

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
0likes803downloads
Dataset Card

语种识别

Tips:

  • 语种 zh 代表是中文, 可能是简体, 也可能是繁体. 语种 zh-cn 则代表是简体中文, zh-tw 代表繁体中文.

数据来源

数据集从网上收集整理如下:

多语言语料

数据原始数据/项目地址样本个数原始数据描述替代数据下载地址
amazonreviewsmultiMultilingual Amazon Reviews Corpus; 2010.02573TRAIN: 1191160, VALID: 29665, TEST: 29685我们提出了多语言亚马逊评论语料库 (MARC),这是用于多语言文本分类的大规模亚马逊评论集合。 该语料库包含 2015 年至 2019 年间收集的英语、日语、德语、法语、西班牙语和中文评论。amazon_reviews_multi
xnliXNLI; D18-1269.pdfTRAIN: 7702055, VALID: 49750, TEST: 100129我们希望我们的数据集 XNLI 能够通过提供信息丰富的标准评估任务来促进跨语言句子理解的研究。xnli
stsbmultimtSemEval-2017 Task 1TRAIN: 104117, VALID: 25943, TEST: 22457使用时注意要打乱。可用语言有:de、en、es、fr、it、nl、pl、pt、ru、zhstsb_multi_mt

语种识别

数据原始数据/项目地址样本个数原始数据描述替代数据下载地址
scandi_langidTRAIN: 239618, TEST: 59840kardosdrur/scandi-langid
nordic_langidDiscriminating Between Similar Nordic LanguagesTRAIN: 226159, TEST: 10700重点关注六种北欧语言之间的区别:丹麦语、瑞典语、挪威语(尼诺斯克语)、挪威语(博克马尔语)、法罗语和冰岛语。strombergnlp/nordic_langid
mike0307Mike0307/language-detectionTRAIN: 33095, VALID: 4040, TEST: 4048
nbnnoai-nb-no-sbr-80TRAIN: 1556212, VALID: 1957, TEST: 1944该语料库包含挪威电报局 (NTB) 的新闻文本从博克马尔语翻译成新挪威语的内容。NbAiLab/nbnn_language_detection

机器翻译

数据原始数据/项目地址样本个数原始数据描述替代数据下载地址
bucc2018bucc2018TRAIN: 2173318, TEST: 2125879共享任务:识别可比语料库中的平行句子,语言:de, en, fr, ru, zh
iwslt20172017.iwslt-1.1.pdfTRAIN: 2482649, VALID: 11480, TEST: 72470IWSLT 2017 多语言任务解决了文本翻译问题,涵盖英语、德语、荷兰语、意大利语和罗马尼亚语等所有方向。iwslt2017
bsdjaen2008.01940v1TRAIN: 35755, VALID: 3636, TEST: 3702尽管由于并行语料库和基于语料库的训练技术的可用性不断增加,书面文本的机器翻译在过去几年中取得了长足的进步,但即使对于现代系统,口语文本和对话的自动翻译仍然具有挑战性。 在本文中,我们的目标是通过引入新构建的日语-英语商务会话平行语料库来提高会话文本的机器翻译质量。bsd_ja_en
autshumatoTRAIN: 652824Autshumato 项目的目标之一是开发三种南非语言对的机器翻译系统。autshumato
chr_en2010.04791样本个数ChrEn 是切罗基语-英语并行数据集,用于促进切罗基语和英语之间的机器翻译研究。 ChrEn 资源极少,总共包含 14k 个句子对,其分割方式有利于域内和域外评估。 ChrEn 还包含 5k 切罗基语单语数据以实现半监督学习。chr_en
cmuhinglishdogCMU_DoG; 1809.07358TRAIN: 13146, VALID: 1645, TEST: 1616这是印度英语(印地语-英语之间的代码混合)文本对话及其相应的英语版本的集合。 可用于两者之间的翻译。 该数据集由 CMU 的 Alan Black 教授团队提供。cmu_hinglish_dog
europaeactmEAC-Translation MemoryTRAIN: 38054该数据集是从英语到多达 25 种语言的手动翻译的语料库,由欧盟教育和文化总局 (EAC) 于 2012 年发布。europa_eac_tm
europaecdctmECDC-Translation MemoryTRAIN: 589682012 年 10 月,欧盟 (EU) 机构“欧洲疾病预防和控制中心”(ECDC) 发布了翻译记忆库 (TM),即 25 种语言的句子及其专业翻译的集合。europa_ecdc_tm
flores1902.01382低资源机器翻译的评估数据集:尼泊尔语-英语和僧伽罗语-英语。flores
giga_frengiga_fren
hind_encorpHindEnCorpTRAIN: 445071HindEnCorp 并行文本(句子对齐)来自以下来源:Tides,其中包含主要取自新闻文章的 50K 句对。 该数据集最初是为 2002 年 DARPA-TIDES 惊喜语言竞赛收集的,后来在 IIIT 海得拉巴进行了完善,并提供给 ICON 2008 的 NLP 工具竞赛(Venkatapathy,2008)。hind_encorp
hrenwac_paraTRAIN: 191946hrenWaC 语料库版本 2.0 由从克罗地亚 .hr 顶级域爬取的并行克罗地亚语-英语文本组成。hrenwac_para
idpanlbpptTRAIN: 47916BPPT(印度尼西亚技术评估和应用机构)为 PAN 本地化项目(发展亚洲本地语言计算能力的区域性倡议)创建的多域翻译系统并行文本语料库。 该数据集包含大约 24K 个句子,分为 4 个不同主题(经济、国际、科学技术和体育)。id_panl_bppt
igboIgbo-English Machine Translation在这项工作中,我们讨论了为伊博语(尼日利亚三种主要语言之一)构建标准机器翻译基准数据集所做的努力。igbo_english_machine_translation
menyo20k_mtmenyo20k_mtTRAIN: 19899, VALID: 6655, TEST: 13148MENYO-20k 是一个多域并行数据集,其中的文本来自新闻文章、ted 演讲、电影文字记录、广播文字记录、科技文本以及其他由网络和专业翻译人员策划的短文。menyo20k_mt
pibCVIT-PIB该数据集是 11 种印度语言的大规模句子对齐语料库,即: CVIT-PIB 语料库是印度语言可用的最大多语言语料库。pib
poleval2019_mtPolEval 是一项受 SemEval 启发的波兰语自然语言处理工具评估活动。poleval2019_mt
wmt19statmt.org我们的目标是尽可能使用公开的数据源。我们的训练数据主要来源是Europarl 语料库、 UN 语料库、新闻评论语料库和 ParaCrawl语料库。我们还发布了单语 新闻抓取语料库。将提供其他特定语言的语料库。wmt/wmt19
rostsparallelTRAIN: 21226, VALID: 5470, TEST: 4693我们提出 RO-STS-Parallel - 通过将 STS 英语数据集翻译成罗马尼亚语而获得的并行罗马尼亚语-英语数据集。ro_sts_parallel

机器翻译

数据原始数据/项目地址样本个数原始数据描述替代数据下载地址
parapatcs_enParaPat; HomepageTRAIN: 156028ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapatde_enParaPat; HomepageTRAIN: 3065565ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapatde_frParaPat; HomepageTRAIN: 1243643ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapatel_enParaPat; HomepageTRAIN: 20234ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_esParaPat; HomepageTRAIN: 1147278ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_huParaPat; HomepageTRAIN: 84824ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_jaParaPat; HomepageTRAIN: 11971591ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_koParaPat; HomepageTRAIN: 4268110ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_ptParaPat; HomepageTRAIN: 42623ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_roParaPat; HomepageTRAIN: 94326ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_ruParaPat; HomepageTRAIN: 6795724ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_skParaPat; HomepageTRAIN: 44337ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_ukParaPat; HomepageTRAIN: 177043ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapaten_zhParaPat; HomepageTRAIN: 9367823ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapates_frParaPat; HomepageTRAIN: 55795ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapatfr_jaParaPat; HomepageTRAIN: 599299ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapatfr_koParaPat; HomepageTRAIN: 200044ParaPat:专利摘要的数百万个句子平行语料库para_pat
parapatfr_ruParaPat; HomepageTRAIN: 19577ParaPat:专利摘要的数百万个句子平行语料库para_pat

机器翻译

https://opus.nlpl.eu/

数据原始数据/项目地址样本个数原始数据描述替代数据下载地址
bible_parabible-uedinTRAIN: 245321这是一个多语言平行语料库,根据 Christos Christodoulopoulos 和 Mark Steedman 编译的圣经翻译创建。bible_para
ecbECB;TRAIN: 713510ecb
emeaEMEA;TRAIN: 2600773emea
kde4KDE4; apps.kde.org; opus.nlpl.euTRAIN: 885030kde4
multiparacrawlParaCrawl; paracrawl.eu; MultiParaCrawlTRAIN: 885030我们报告了使用开源软件通过抓取网络来创建最大的公开可用并行语料库的方法。multi_para_crawl
open_subtitlesOpenSubtitles; L16-1147.pdfTRAIN: 11662044我们推出了平行语料库 OpenSubtitles 集合的新主要版本。 该版本由大型电影和电视字幕数据库编译而成,共包含 1689 个双文本,涵盖 60 种语言的 26 亿个句子。 该版本还包含了字幕预处理和对齐方面的许多增强功能,例如自动更正 OCR 错误以及使用元数据来估计每个字幕的质量并对字幕对进行评分。open_subtitles
para_crawlParaCrawl; ParaCrawl欧洲官方语言的网络规模并行语料库。para_crawl
phpPHPTRAIN: 44007最初从 http://se.php.net/download-docs.php 中提取的并行语料库。该语料库相当嘈杂。php
tatoebaTatoeba; tatoeba; Tatoeba PaperTRAIN: 702895Tatoeba 是句子和翻译的集合。tatoeba
qed_amaraQEDTRAIN: 4183836qed_amara
setimesSETIMES英语和东南欧语言平行语料库setimes
spcSPCTRAIN: 98327spc
tanzilTanzil样本个数tanzil

机器翻译

https://opus.nlpl.eu/

数据原始数据/项目地址样本个数原始数据描述替代数据下载地址
paracrawlen_bgParaCrawl; ParaCrawlTRAIN: 1967082欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_csParaCrawl; ParaCrawlTRAIN: 5601171欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_daParaCrawl; ParaCrawlTRAIN: 4617796欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_deParaCrawl; ParaCrawlTRAIN: 31041474欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_elParaCrawl; ParaCrawlTRAIN: 3799096欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_es (MemoryError)ParaCrawl; ParaCrawlMemoryError欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_etParaCrawl; ParaCrawlTRAIN: 1625870欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_fiParaCrawl; ParaCrawlTRAIN: 4071888欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_fr (MemoryError)ParaCrawl; ParaCrawlMemoryError欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_gaParaCrawl; ParaCrawlTRAIN: 686474欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_hrParaCrawl; ParaCrawlTRAIN: 1911081欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_huParaCrawl; ParaCrawlTRAIN: 3292718欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_itParaCrawl; ParaCrawlTRAIN: 22718884欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_ltParaCrawl; ParaCrawlTRAIN: 1554000欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_lvParaCrawl; ParaCrawlTRAIN: 1059209欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_mtParaCrawl; ParaCrawlTRAIN: 379616欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_plParaCrawl; ParaCrawlTRAIN: 6537110欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_ptParaCrawl; ParaCrawlTRAIN: 15186124欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_roParaCrawl; ParaCrawlTRAIN: 3580912欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_skParaCrawl; ParaCrawlTRAIN: 3047345欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_slParaCrawl; ParaCrawlTRAIN: 1282153欧洲官方语言的网络规模并行语料库。para_crawl
paracrawlen_svParaCrawl; ParaCrawlTRAIN: 6626302欧洲官方语言的网络规模并行语料库。para_crawl

参考来源

<details> <summary>参考的数据来源,展开查看</summary> <pre><code> https://huggingface.co/datasets/papluca/language-identification https://huggingface.co/datasets/unklefedor/language-identification

https://github.com/quincyliang/nlp-public-dataset

https://opus.nlpl.eu/

</code></pre> </details>