CoolFace
Datasetpublic

HCAI-Lab-GT/dolma3-6t-sample-10000-docs-finance-and-business

HCAI-Lab/dolma3-6t-sample-10000-docs-finance-and-business Filename-derived finance_and_business slice of HCAI-Lab/dolma3-6t-sample-10000-docs, pinned to revision 561e73c7e0ad35c04f386bae1e3dd39dfb6755e7. Extraction rule The corpus contains every source .jsonl.zst file whose filename contains the literal segment -finance_and_business-. Source paths and compressed file contents are preserved byte-for-byte. This is a coarse WebOrganizer finance_and_business category… See the full description on the dataset page: https://huggingface.co/datasets/HCAI-Lab-GT/dolma3-6t-sample-10000-docs-finance-and-business.

sourceHugging Faceodc-byupdated 1mo agoView on Hugging Face
0likes281downloads
Dataset Card

HCAI-Lab/dolma3-6t-sample-10000-docs-finance-and-business

Filename-derived finance_and_business slice of `HCAI-Lab/dolma3-6t-sample-10000-docs`, pinned to revision 561e73c7e0ad35c04f386bae1e3dd39dfb6755e7.

Extraction rule

The corpus contains every source .jsonl.zst file whose filename contains the literal segment -finance_and_business-. Source paths and compressed file contents are preserved byte-for-byte. This is a coarse WebOrganizer finance_and_business category, not a human-verified finance-only corpus; it can contain finance, general business, and classification noise.

Validated contents

  • —Source shards: 2,690
  • —Documents: 350,130
  • —Unique document IDs: 350,130
  • —Duplicate document IDs: 0
  • —Empty-text documents: 0
  • —Compressed bytes: 868,927,169

Each source record is unchanged and contains at least id, text, and metadata. source_shards.jsonl records per-shard counts and sizes; validation_report.json records corpus-level provenance and validation totals.

Provenance

  • —Source dataset: HCAI-Lab/dolma3-6t-sample-10000-docs
  • —Source revision: 561e73c7e0ad35c04f386bae1e3dd39dfb6755e7
  • —Selection label: finance_and_business
  • —Selection mechanism: exact marker match against the source filename