jbduran/bartholomew-dataset-v2
BART Dataset v2 The second version of the BART pretraining corpus, focused on stripping low-quality text — boilerplate and OCR corruption — out of v1. Documents 149,745 (93.44% of v1) Characters 106,274,384,672 (89.50% of v1) Tokens ~24B (estimated) Shards 473 (one per v1 shard, same basename) Source BART Dataset v1 Schema single string column text Lineage — three cumulative filtering stages over the same corpus: Institutional Books 1.0 → v1 → v2 → v3… See the full description on the dataset page: https://huggingface.co/datasets/jbduran/bartholomew-dataset-v2.
Add MIT license to dataset card metadata
Rewrite dataset card: BART v-series naming, provenance narrative, lineage links
update cleaning report
clean shard_00472.parquet
clean shard_00471.parquet
clean shard_00470.parquet
clean shard_00469.parquet
clean shard_00468.parquet
clean shard_00467.parquet
clean shard_00466.parquet
clean shard_00465.parquet
clean shard_00464.parquet
clean shard_00463.parquet
clean shard_00462.parquet
clean shard_00461.parquet
clean shard_00460.parquet
clean shard_00459.parquet
clean shard_00458.parquet
clean shard_00457.parquet
clean shard_00456.parquet
clean shard_00455.parquet
clean shard_00454.parquet
clean shard_00453.parquet
clean shard_00452.parquet
clean shard_00451.parquet
clean shard_00450.parquet
clean shard_00449.parquet
clean shard_00448.parquet
clean shard_00447.parquet
clean shard_00446.parquet
clean shard_00445.parquet
clean shard_00444.parquet
clean shard_00443.parquet
clean shard_00442.parquet
clean shard_00441.parquet
clean shard_00440.parquet
clean shard_00439.parquet
clean shard_00438.parquet
clean shard_00437.parquet
clean shard_00436.parquet
clean shard_00435.parquet
clean shard_00434.parquet
clean shard_00433.parquet
clean shard_00432.parquet
clean shard_00431.parquet
clean shard_00430.parquet
clean shard_00429.parquet
clean shard_00428.parquet
clean shard_00427.parquet
clean shard_00426.parquet
