CoolFace
Datasetpublic

BEE-spoke-data/govdocs1-by-extension

govdocs1 Dataset: By File Extension [!NOTE] PDFs from govdocs1 are at this repo in "raw" file form - no simple "mostly correct" way to convert to text Markdown-parsed versions of documents in govdocs1 with light filtering. Usage Load specific file formats (e.g., .doc files) parsed to markdown with pandoc: from datasets import load_dataset # Replace "doc" with desired config name dataset = load_dataset("BEE-spoke-data/govdocs1-by-extension", "doc")… See the full description on the dataset page: https://huggingface.co/datasets/BEE-spoke-data/govdocs1-by-extension.

sourceHugging Faceodc-byupdated 9mo agoView on Hugging Face
2likes711downloads
../
filetest-00000-of-00001-bd877469831937cf.parquet226 KBdownload
filetrain-00000-of-00001-fc2f430f145e1127.parquet4.6 MBdownload
filevalidation-00000-of-00001-6583b62b6d791ba4.parquet263 KBdownload

BEE-spoke-data/govdocs1-by-extension · main · files are served by the source, never re-hosted here