DaveGabe/cwt-multilingual-pretrain-mix
CWT Multilingual Pretrain Mix (reproducible recipe) A deterministic multilingual-including-English pretraining corpus for controlled vocabulary-scaling studies. The raw text is not stored here — it is reproduced byte-identically from manifest.json + the pinned dataset revisions, with no sampling and no RNG (the first-N documents of each stream). Recipe English: HuggingFaceFW/fineweb config sample-10BT, revision 9bb295ddab0e05d785b879661af7260fed5140fc… See the full description on the dataset page: https://huggingface.co/datasets/DaveGabe/cwt-multilingual-pretrain-mix.
09
Upload rebuild_dataset.py with huggingface_hub
Upload manifest.json with huggingface_hub
Upload README.md with huggingface_hub
initial commit
