CoolFace
Datasetpublic

exnivo/tinybrain-pretrain-corpus-2b

TinyBrain Pretrain Corpus 2B A mixed-source English pretraining corpus for training small language models. TinyBrain Pretrain Corpus 2B is a mixed-source dataset built for pretraining small causal language models, especially the TinyBrain-100M Base model. The dataset combines educational text, factual/wiki-style text, math reasoning data, Python code-summary data, clean web text, and conversation-style data. It is designed to give small models a useful general foundation… See the full description on the dataset page: https://huggingface.co/datasets/exnivo/tinybrain-pretrain-corpus-2b.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
1likes132downloads

exnivo/tinybrain-pretrain-corpus-2b · main · files are served by the source, never re-hosted here