CoolFace
Datasetpublic

BEE-spoke-data/govdocs1-by-extension

govdocs1 Dataset: By File Extension [!NOTE] PDFs from govdocs1 are at this repo in "raw" file form - no simple "mostly correct" way to convert to text Markdown-parsed versions of documents in govdocs1 with light filtering. Usage Load specific file formats (e.g., .doc files) parsed to markdown with pandoc: from datasets import load_dataset # Replace "doc" with desired config name dataset = load_dataset("BEE-spoke-data/govdocs1-by-extension", "doc")… See the full description on the dataset page: https://huggingface.co/datasets/BEE-spoke-data/govdocs1-by-extension.

sourceHugging Faceodc-byupdated 9mo agoView on Hugging Face
2likes711downloads

BEE-spoke-data/govdocs1-by-extension · main · files are served by the source, never re-hosted here