BEE-spoke-data/govdocs1-by-extension
govdocs1 Dataset: By File Extension [!NOTE] PDFs from govdocs1 are at this repo in "raw" file form - no simple "mostly correct" way to convert to text Markdown-parsed versions of documents in govdocs1 with light filtering. Usage Load specific file formats (e.g., .doc files) parsed to markdown with pandoc: from datasets import load_dataset # Replace "doc" with desired config name dataset = load_dataset("BEE-spoke-data/govdocs1-by-extension", "doc")… See the full description on the dataset page: https://huggingface.co/datasets/BEE-spoke-data/govdocs1-by-extension.
govdocs1 Dataset: By File Extension
[!NOTE] PDFs from govdocs1 are at this repo in "raw" file form - no simple "mostly correct" way to convert to text
Markdown-parsed versions of documents in govdocs1 with light filtering.
Usage
Load specific file formats (e.g., .doc files) parsed to markdown with pandoc:
from datasets import load_dataset
# Replace "doc" with desired config name
dataset = load_dataset("BEE-spoke-data/govdocs1-by-extension", "doc")Configurations
This dataset includes multiple configurations, each corresponding to a different file extension:
docdocxlogspptpptxrtftxt
Each configuration contains train, validation, and test splits.
Dataset Details
- Download Size: Varies by configuration
- Dataset Size: Varies by configuration
- Splits: Train, Validation, Test
- Features: Section, Filename, Text
counts
Here's a summary of the number of examples for each configuration in the dataset (thus far):
- DOC Configuration
- Train Examples: 38,094
- Validation Examples: 1,002
- Test Examples: 1,003
- DOCX Configuration
- Train Examples: 141
- Validation Examples: 8
- Test Examples: 8
- Logs Configuration
- Train Examples: 9,223
- Validation Examples: 243
- Test Examples: 243
- PPT Configuration
- Train Examples: 13,865
- Validation Examples: 365
- Test Examples: 365
- PPTX Configuration
- Train Examples: 963
- Validation Examples: 53
- Test Examples: 54
- RTF Configuration
- Train Examples: 942
- Validation Examples: 52
- Test Examples: 53
- TXT Configuration
- Train Examples: 41,393
- Validation Examples: 1,089
- Test Examples: 1,090
Citation
@inproceedings{garfinkel2009bringing,
title={Bringing Science to Digital Forensics with Standardized Forensic Corpora},
author={Garfinkel, Simson and others},
booktitle={Digital Forensic Research Workshop (DFRWS) 2009},
year={2009},
address={Montreal, Canada},
url={https://digitalcorpora.org/corpora/file-corpora/files/}
}For more detailed information on each configuration, refer to the dataset documentation.
