CoolFace
Datasetpublic

DaveGabe/cwt-multilingual-pretrain-mix

CWT Multilingual Pretrain Mix (reproducible recipe) A deterministic multilingual-including-English pretraining corpus for controlled vocabulary-scaling studies. The raw text is not stored here — it is reproduced byte-identically from manifest.json + the pinned dataset revisions, with no sampling and no RNG (the first-N documents of each stream). Recipe English: HuggingFaceFW/fineweb config sample-10BT, revision 9bb295ddab0e05d785b879661af7260fed5140fc… See the full description on the dataset page: https://huggingface.co/datasets/DaveGabe/cwt-multilingual-pretrain-mix.

sourceHugging Faceodc-byupdated 4mo agoView on Hugging Face
0likes9downloads
4 commits on main
7dfbd614mo ago

Upload rebuild_dataset.py with huggingface_hub

DaveGabe
ced110a4mo ago

Upload manifest.json with huggingface_hub

DaveGabe
64f5f444mo ago

Upload README.md with huggingface_hub

DaveGabe
b27c4304mo ago

initial commit

DaveGabe