historical-text
UN_Historical_PDF_Article_Text_Corpus
python
dataset = load_dataset("ranWang/UN_Historical_PDF_Article_Text_Corpus", split="train")
or
dataset = load_dataset("ranWang/UN_Historical_PDF_Article_Text_Corpus", split="randomTest")
lang_list = ["ar", "en", "es", "fr", "ru", "zh"]
for row in dataset:
# 获取pdf文章内容
for lang in lang_list:
# type == str
lang_match_file_content = row[lang]
# 如果按页分割
lang_match_file_pages_content = lang_match_file_content.split("\n----\n")
HIPE2020_sent-splitTODOhipe2020TODOhistorical_texts
Dataset Card for "historical_texts"
More Information needed
Open_Medieval_French
Open Medieval French
Source: https://github.com/OpenMedFr/texts
ranWang_UN_Historical_PDF_Article_Text_CorpusCe répertoire est vide, il a été créé pour améliorer le référencement du jeu de données ranWang/UN_Historical_PDF_Article_Text_Corpus.
