CoolFace
Datasetpublic

YangyiH/DepthBench-FineWeb-Edu-100BT-tokenized

DepthBench FineWeb-Edu 100BT Tokenized This repository contains the tokenized FineWeb-Edu 100BT sample used by DepthBench pretraining experiments. Splits train/: 139 shards, 99,585,913,529 tokens, and 97,045,608 documents. eval/: 013_00008, containing 234,993,701 tokens and 225,078 documents. All remaining source shards are assigned to training. Each source document is terminated by an EOS token before documents are concatenated. Format Each shard… See the full description on the dataset page: https://huggingface.co/datasets/YangyiH/DepthBench-FineWeb-Edu-100BT-tokenized.

sourceHugging Faceupdated 2mo agoView on Hugging Face
0likes237downloads
9 commits on main
315a60a2mo ago

Add files using upload-large-folder tool

YangyiH
78d6e4f2mo ago

Add files using upload-large-folder tool

YangyiH
f549c562mo ago

Add files using upload-large-folder tool

YangyiH
b45a9922mo ago

Add files using upload-large-folder tool

YangyiH
a8e5f492mo ago

Add files using upload-large-folder tool

YangyiH
9e56a7d2mo ago

Add files using upload-large-folder tool

YangyiH
bb7dff92mo ago

Add tokenizer

YangyiH
0f704372mo ago

Add dataset card

YangyiH
1e856ef2mo ago

initial commit

YangyiH