sol-r/historica-corpus
Historica Corpus v2 A monolingual pretraining corpus of 314,438 passages (177M words, 1.1B characters) spanning 15 ancient and historical languages, from 500 BCE to 1750 CE. What's New in v2 2x more passages (314k vs 159k) due to varied-length chunking SGML entity resolution: Middle English þ/ȝ/ð properly rendered (928k entities fixed) PROIEL punctuation: reconstructed from presentation-after attributes TEI apparatus handling: <lem> (main reading) preserved… See the full description on the dataset page: https://huggingface.co/datasets/sol-r/historica-corpus.
Delete data/train-00007-of-00008.parquet with huggingface_hub
Delete data/train-00006-of-00008.parquet with huggingface_hub
Delete data/train-00005-of-00008.parquet with huggingface_hub
Delete data/train-00004-of-00008.parquet with huggingface_hub
Delete data/train-00003-of-00008.parquet with huggingface_hub
Delete data/train-00002-of-00008.parquet with huggingface_hub
Delete data/train-00001-of-00008.parquet with huggingface_hub
Delete data/train-00000-of-00008.parquet with huggingface_hub
Upload data/train-00008-of-00009.parquet with huggingface_hub
Upload data/train-00007-of-00009.parquet with huggingface_hub
Upload data/train-00006-of-00009.parquet with huggingface_hub
Upload data/train-00005-of-00009.parquet with huggingface_hub
Upload data/train-00004-of-00009.parquet with huggingface_hub
Upload data/train-00003-of-00009.parquet with huggingface_hub
Upload data/train-00002-of-00009.parquet with huggingface_hub
Upload data/train-00001-of-00009.parquet with huggingface_hub
Upload data/train-00000-of-00009.parquet with huggingface_hub
Upload README.md with huggingface_hub
Delete data/train-00004-of-00005.parquet with huggingface_hub
Delete data/train-00003-of-00004.parquet with huggingface_hub
Delete data/train-00002-of-00004.parquet with huggingface_hub
Delete data/train-00001-of-00004.parquet with huggingface_hub
Delete data/train-00000-of-00004.parquet with huggingface_hub
Upload data/train-00007-of-00008.parquet with huggingface_hub
Upload data/train-00006-of-00008.parquet with huggingface_hub
Upload data/train-00005-of-00008.parquet with huggingface_hub
Upload data/train-00004-of-00008.parquet with huggingface_hub
Upload data/train-00003-of-00008.parquet with huggingface_hub
Upload data/train-00002-of-00008.parquet with huggingface_hub
Upload data/train-00001-of-00008.parquet with huggingface_hub
Upload data/train-00000-of-00008.parquet with huggingface_hub
Upload data/train-00004-of-00005.parquet with huggingface_hub
Delete files corpus.jsonl corpus_shuffled.jsonl with huggingface_hub
Upload folder using huggingface_hub
Upload data/train-00003-of-00004.parquet with huggingface_hub
Upload data/train-00002-of-00004.parquet with huggingface_hub
Upload data/train-00001-of-00004.parquet with huggingface_hub
Upload data/train-00000-of-00004.parquet with huggingface_hub
Upload README.md with huggingface_hub
initial commit
