Usmansafder/fineweb-edu-2014-qwen2
FineWeb-Edu 2014, Qwen2-7B token counts 86,901,732 documents, 92,348,618,822 Qwen2-7B tokens, prepared for continued pretraining as part of the FinMoE project. column type meaning date int32 the FineWeb year, 2014 text string document text, unmodified token_count int32 Qwen2-7B tokens in text Source HuggingFaceFW/fineweb-edu at revision 87f09149ef4734204d70ed1d046ddc9ca3f2b8f9, all 8 CommonCrawl dumps of 2014 (115 shards). Token… See the full description on the dataset page: https://huggingface.co/datasets/Usmansafder/fineweb-edu-2014-qwen2.
State the literal base_seed values alongside the <year>0101 rule
Note path mapping when the project docs are read inside a dataset repo
Note path mapping when the project docs are read inside a dataset repo
Correct paths to repository-relative, document verifier difference and hashing
Fix provenance hashes to uploaded bytes (LF), add missing verifier, correct paths and version counts
Add 2014 staged-shards-vs-source validation output
Add reproducibility overview
Add reproducibility materials: shard manifest, kernels as run, provenance, validation output
Upload README.md with huggingface_hub
Upload processing_metadata.json with huggingface_hub
Upload data/train-00070-of-00115.parquet with huggingface_hub
Upload data/train-00092-of-00115.parquet with huggingface_hub
Upload data/train-00069-of-00115.parquet with huggingface_hub
Upload data/train-00103-of-00115.parquet with huggingface_hub
Upload data/train-00091-of-00115.parquet with huggingface_hub
Upload data/train-00068-of-00115.parquet with huggingface_hub
Upload data/train-00114-of-00115.parquet with huggingface_hub
Upload data/train-00102-of-00115.parquet with huggingface_hub
Upload data/train-00090-of-00115.parquet with huggingface_hub
Upload data/train-00113-of-00115.parquet with huggingface_hub
Upload data/train-00101-of-00115.parquet with huggingface_hub
Upload data/train-00067-of-00115.parquet with huggingface_hub
Upload data/train-00089-of-00115.parquet with huggingface_hub
Upload data/train-00112-of-00115.parquet with huggingface_hub
Upload data/train-00100-of-00115.parquet with huggingface_hub
Upload data/train-00066-of-00115.parquet with huggingface_hub
Upload data/train-00081-of-00115.parquet with huggingface_hub
Upload data/train-00111-of-00115.parquet with huggingface_hub
Upload data/train-00088-of-00115.parquet with huggingface_hub
Upload data/train-00080-of-00115.parquet with huggingface_hub
Upload data/train-00099-of-00115.parquet with huggingface_hub
Upload data/train-00110-of-00115.parquet with huggingface_hub
Upload data/train-00065-of-00115.parquet with huggingface_hub
Upload data/train-00087-of-00115.parquet with huggingface_hub
Upload data/train-00079-of-00115.parquet with huggingface_hub
Upload data/train-00098-of-00115.parquet with huggingface_hub
Upload data/train-00109-of-00115.parquet with huggingface_hub
Upload data/train-00078-of-00115.parquet with huggingface_hub
Upload data/train-00064-of-00115.parquet with huggingface_hub
Upload data/train-00086-of-00115.parquet with huggingface_hub
Upload data/train-00097-of-00115.parquet with huggingface_hub
Upload data/train-00077-of-00115.parquet with huggingface_hub
Upload data/train-00108-of-00115.parquet with huggingface_hub
Upload data/train-00063-of-00115.parquet with huggingface_hub
Upload data/train-00076-of-00115.parquet with huggingface_hub
Upload data/train-00085-of-00115.parquet with huggingface_hub
Upload data/train-00096-of-00115.parquet with huggingface_hub
Upload data/train-00107-of-00115.parquet with huggingface_hub
Upload data/train-00075-of-00115.parquet with huggingface_hub
Upload data/train-00062-of-00115.parquet with huggingface_hub
