CoolFace
Datasetpublic

SlayerLab/minimal-en-corpus-2.5b-v2

Minimal EN Corpus 2.5B 2.0 A deterministic English-language pretraining corpus for approximately 125M-parameter GPT-style models. This is the curated 2.0 generation of Minimal EN Corpus: source-pinned, model-free quality filtered, exact- and near-deduplicated, and decontaminated against the public evaluation splits of ARC, HellaSwag, PIQA, WinoGrande, OpenBookQA, BoolQ, MMLU, and GSM8K. The name refers to the original approximately 2.5B-token source mixture. After cleaning… See the full description on the dataset page: https://huggingface.co/datasets/SlayerLab/minimal-en-corpus-2.5b-v2.

sourceHugging Faceupdated 3d agoView on Hugging Face
0likes342downloads
3 commits on main
49916cc3d ago

Add 32k and 49k CustomBPE and SuperBPE tokenizers

dawidmajewski
63140093d ago

Add files using upload-large-folder tool

dawidmajewski
62f225c3d ago

initial commit

dawidmajewski