mhla/pre1900-corpus
Pre-1900 Corpus The training corpus for GPT-1900 — a cleaned collection of pre-1900 English-language texts with full metadata. Every document in this corpus was published before the year 1900. Schema Column Type Description text string Full document text year int64 Publication year title string Book title or newspaper name source string Source dataset identifier ocr_score float64 OCR confidence score (-1.0 if unavailable) legibility float64… See the full description on the dataset page: https://huggingface.co/datasets/mhla/pre1900-corpus.
4281
shard_00000.parquetdownload
shard_00001.parquetdownload
shard_00002.parquetdownload
shard_00003.parquetdownload
shard_00004.parquetdownload
shard_00005.parquetdownload
shard_00006.parquetdownload
shard_00007.parquetdownload
shard_00008.parquetdownload
shard_00009.parquetdownload
shard_00010.parquetdownload
shard_00011.parquetdownload
shard_00012.parquetdownload
shard_00013.parquetdownload
shard_00014.parquetdownload
shard_00015.parquetdownload
shard_00016.parquetdownload
shard_00017.parquetdownload
shard_00018.parquetdownload
shard_00019.parquetdownload
shard_00020.parquetdownload
shard_00021.parquetdownload
shard_00022.parquetdownload
shard_00023.parquetdownload
shard_00024.parquetdownload
shard_00025.parquetdownload
shard_00026.parquetdownload
shard_00027.parquetdownload
shard_00028.parquetdownload
shard_00029.parquetdownload
shard_00030.parquetdownload
shard_00031.parquetdownload
shard_00032.parquetdownload
shard_00033.parquetdownload
shard_00034.parquetdownload
shard_00035.parquetdownload
shard_00036.parquetdownload
shard_00037.parquetdownload
shard_00038.parquetdownload
shard_00039.parquetdownload
shard_00040.parquetdownload
shard_00041.parquetdownload
