ncylich/temporal-moe-corpus
temporal-moe-corpus Tokenized training corpus for the Temporal-MoE experiments, 31.3 GiB. This repository holds the tokenized corpus in Megatron indexed-dataset format, plus the 16k tokenizer. It is what the training runs actually read. The raw web-crawl text is not hosted here, because it is a byte-reproducible subset of a public dataset. The exact recipe and the checksums needed to verify a reproduction are below. Contents dclm_tokenized/ 22 x… See the full description on the dataset page: https://huggingface.co/datasets/ncylich/temporal-moe-corpus.
0200
1*.7z filter=lfs diff=lfs merge=lfs -text2*.arrow filter=lfs diff=lfs merge=lfs -text3*.avro filter=lfs diff=lfs merge=lfs -text4*.bin filter=lfs diff=lfs merge=lfs -text5*.bz2 filter=lfs diff=lfs merge=lfs -text6*.ckpt filter=lfs diff=lfs merge=lfs -text7*.ftz filter=lfs diff=lfs merge=lfs -text8*.gz filter=lfs diff=lfs merge=lfs -text9*.h5 filter=lfs diff=lfs merge=lfs -text10*.joblib filter=lfs diff=lfs merge=lfs -text11*.lfs.* filter=lfs diff=lfs merge=lfs -text12*.lz4 filter=lfs diff=lfs merge=lfs -text13*.mds filter=lfs diff=lfs merge=lfs -text14*.mlmodel filter=lfs diff=lfs merge=lfs -text15*.model filter=lfs diff=lfs merge=lfs -text16*.msgpack filter=lfs diff=lfs merge=lfs -text17*.npy filter=lfs diff=lfs merge=lfs -text18*.npz filter=lfs diff=lfs merge=lfs -text19*.onnx filter=lfs diff=lfs merge=lfs -text20*.ot filter=lfs diff=lfs merge=lfs -text21*.parquet filter=lfs diff=lfs merge=lfs -text22*.pb filter=lfs diff=lfs merge=lfs -text23*.pickle filter=lfs diff=lfs merge=lfs -text24*.pkl filter=lfs diff=lfs merge=lfs -text25*.pt filter=lfs diff=lfs merge=lfs -text26*.pth filter=lfs diff=lfs merge=lfs -text27*.rar filter=lfs diff=lfs merge=lfs -text28*.safetensors filter=lfs diff=lfs merge=lfs -text29saved_model/**/* filter=lfs diff=lfs merge=lfs -text30*.tar.* filter=lfs diff=lfs merge=lfs -text31*.tar filter=lfs diff=lfs merge=lfs -text32*.tflite filter=lfs diff=lfs merge=lfs -text33*.tgz filter=lfs diff=lfs merge=lfs -text34*.wasm filter=lfs diff=lfs merge=lfs -text35*.xz filter=lfs diff=lfs merge=lfs -text36*.zip filter=lfs diff=lfs merge=lfs -text37*.zst filter=lfs diff=lfs merge=lfs -text38*tfevents* filter=lfs diff=lfs merge=lfs -text39# Audio files - uncompressed40*.pcm filter=lfs diff=lfs merge=lfs -text41*.sam filter=lfs diff=lfs merge=lfs -text42*.raw filter=lfs diff=lfs merge=lfs -text43# Audio files - compressed44*.aac filter=lfs diff=lfs merge=lfs -text45*.flac filter=lfs diff=lfs merge=lfs -text46*.mp3 filter=lfs diff=lfs merge=lfs -text47*.ogg filter=lfs diff=lfs merge=lfs -text48*.wav filter=lfs diff=lfs merge=lfs -text49# Image files - uncompressed50*.bmp filter=lfs diff=lfs merge=lfs -text51*.gif filter=lfs diff=lfs merge=lfs -text52*.png filter=lfs diff=lfs merge=lfs -text53*.tiff filter=lfs diff=lfs merge=lfs -text54# Image files - compressed55*.jpg filter=lfs diff=lfs merge=lfs -text56*.jpeg filter=lfs diff=lfs merge=lfs -text57*.webp filter=lfs diff=lfs merge=lfs -text58# Video files - compressed59*.mp4 filter=lfs diff=lfs merge=lfs -text60*.webm filter=lfs diff=lfs merge=lfs -text61dclm_tokenized/part20_text_document.idx filter=lfs diff=lfs merge=lfs -text62dclm_tokenized/part10_text_document.idx filter=lfs diff=lfs merge=lfs -text63tok16k_full/part03_text_document.idx filter=lfs diff=lfs merge=lfs -text64dclm_tokenized/part18_text_document.idx filter=lfs diff=lfs merge=lfs -text65dclm_tokenized/part13_text_document.idx filter=lfs diff=lfs merge=lfs -text66tok16k_full/part01_text_document.idx filter=lfs diff=lfs merge=lfs -text67tok16k_full/part00_text_document.idx filter=lfs diff=lfs merge=lfs -text68tok16k_full/part04_text_document.idx filter=lfs diff=lfs merge=lfs -text69dclm_tokenized/part17_text_document.idx filter=lfs diff=lfs merge=lfs -text70tok16k_full/part10_text_document.idx filter=lfs diff=lfs merge=lfs -text71dclm_tokenized/part07_text_document.idx filter=lfs diff=lfs merge=lfs -text72dclm_tokenized/part05_text_document.idx filter=lfs diff=lfs merge=lfs -text73tok16k_full/part09_text_document.idx filter=lfs diff=lfs merge=lfs -text74dclm_tokenized/part08_text_document.idx filter=lfs diff=lfs merge=lfs -text75dclm_tokenized/part09_text_document.idx filter=lfs diff=lfs merge=lfs -text76dclm_tokenized/part19_text_document.idx filter=lfs diff=lfs merge=lfs -text77tok16k_full/part11_text_document.idx filter=lfs diff=lfs merge=lfs -text78dclm_tokenized/part16_text_document.idx filter=lfs diff=lfs merge=lfs -text79dclm_tokenized/part15_text_document.idx filter=lfs diff=lfs merge=lfs -text80tok16k_full/part08_text_document.idx filter=lfs diff=lfs merge=lfs -text81dclm_tokenized/part21_text_document.idx filter=lfs diff=lfs merge=lfs -text82dclm_tokenized/part11_text_document.idx filter=lfs diff=lfs merge=lfs -text83tok16k_full/part06_text_document.idx filter=lfs diff=lfs merge=lfs -text84dclm_tokenized/part12_text_document.idx filter=lfs diff=lfs merge=lfs -text85dclm_tokenized/part04_text_document.idx filter=lfs diff=lfs merge=lfs -text86dclm_tokenized/part00_text_document.idx filter=lfs diff=lfs merge=lfs -text87dclm_tokenized/part01_text_document.idx filter=lfs diff=lfs merge=lfs -text88tok16k_full/part02_text_document.idx filter=lfs diff=lfs merge=lfs -text89dclm_tokenized/part06_text_document.idx filter=lfs diff=lfs merge=lfs -text90dclm_tokenized/part03_text_document.idx filter=lfs diff=lfs merge=lfs -text91tok16k_full/part05_text_document.idx filter=lfs diff=lfs merge=lfs -text92dclm_tokenized/part02_text_document.idx filter=lfs diff=lfs merge=lfs -text93dclm_tokenized/part14_text_document.idx filter=lfs diff=lfs merge=lfs -text94tok16k_full/part07_text_document.idx filter=lfs diff=lfs merge=lfs -text95 