CoolFace
Datasetpublic

Ayushnangia/dolma3-hq-2M-modernbert

Dolma3 High-Quality 2M (ModernBERT Filtered) A curated subset of 2 million high-quality text samples from allenai/dolma3_dolmino_mix-100B-1125, filtered to fit within ModernBERT's 8192 token context window. Dataset Description This dataset is designed for pretraining diffusion language models based on ModernBERT. Each sample has been: Source filtered: Only from ingredient1-common_crawl-high-quality folders (highest quality web text) Length filtered: Minimum 200… See the full description on the dataset page: https://huggingface.co/datasets/Ayushnangia/dolma3-hq-2M-modernbert.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
0likes185downloads
3 commits on main
7d643a58mo ago

Add dataset card

Ayushnangia
9a2101b8mo ago

Upload dolma3 high-quality 2M samples (filtered to ≤8192 ModernBERT tokens)

Ayushnangia
15d74758mo ago

initial commit

Ayushnangia