CoolFace
Datasetpublic

BEE-spoke-data/govdocs1-by-extension

govdocs1 Dataset: By File Extension [!NOTE] PDFs from govdocs1 are at this repo in "raw" file form - no simple "mostly correct" way to convert to text Markdown-parsed versions of documents in govdocs1 with light filtering. Usage Load specific file formats (e.g., .doc files) parsed to markdown with pandoc: from datasets import load_dataset # Replace "doc" with desired config name dataset = load_dataset("BEE-spoke-data/govdocs1-by-extension", "doc")… See the full description on the dataset page: https://huggingface.co/datasets/BEE-spoke-data/govdocs1-by-extension.

sourceHugging Faceodc-byupdated 9mo agoView on Hugging Face
2likes711downloads
../
filetest-00000-of-00001-4949fb33a0220727.parquet1.2 MBdownload
filetrain-00000-of-00001-6b7b60c701f16413.parquet19.0 MBdownload
filevalidation-00000-of-00001-94049932e44eafb8.parquet1.3 MBdownload

BEE-spoke-data/govdocs1-by-extension · main · files are served by the source, never re-hosted here