CoolFace
Datasetpublic

exnivo/tinybrain-pretrain-corpus-2b

TinyBrain Pretrain Corpus 2B A mixed-source English pretraining corpus for training small language models. TinyBrain Pretrain Corpus 2B is a mixed-source dataset built for pretraining small causal language models, especially the TinyBrain-100M Base model. The dataset combines educational text, factual/wiki-style text, math reasoning data, Python code-summary data, clean web text, and conversation-style data. It is designed to give small models a useful general foundation… See the full description on the dataset page: https://huggingface.co/datasets/exnivo/tinybrain-pretrain-corpus-2b.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
1likes132downloads
settings

This repository belongs to exnivo on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

nametinybrain-pretrain-corpus-2b
visibilitypublic
licenceother
gatedno
ownerexnivo
Account settings
exnivo/tinybrain-pretrain-corpus-2b · CoolFace