CoolFace
Datasetpublic

jhu-clsp/ettin-pretraining-data

Ettin Pre-training Data Phase 1 of 3: Diverse pre-training data mixture (1.7T tokens) used to train the Ettin model suite. This dataset contains the pre-training phase data used to train all Ettin encoder and decoder models. The data is provided in MDS format ready for use with Composer and the ModernBERT training repository. πŸ“Š Data Composition Data Source Tokens (B) Percentage Description DCLM 837.2 49.1% High-quality web crawl data CC Head… See the full description on the dataset page: https://huggingface.co/datasets/jhu-clsp/ettin-pretraining-data.

sourceHugging Facemitupdated 1y agoView on Hugging Face
10likes276kdownloads
Dataset Card

Ettin Pre-training Data

![License: MIT](https://opensource.org/licenses/MIT) ![Paper](https://arxiv.org/abs/2507.11412) ![Models](https://huggingface.co/jhu-clsp) ![GitHub](https://github.com/jhu-clsp/ettin-encoder-vs-decoder)

Phase 1 of 3: Diverse pre-training data mixture (1.7T tokens) used to train the Ettin model suite.

This dataset contains the pre-training phase data used to train all Ettin encoder and decoder models. The data is provided in MDS format ready for use with Composer and the ModernBERT training repository.

πŸ“Š Data Composition

Data SourceTokens (B)PercentageDescription
DCLM837.249.1%High-quality web crawl data
CC Head356.620.9%Common Crawl head documents
Starcoder263.915.5%Code repositories and files
Reddit80.34.7%Social discussion threads
PeS2o57.33.4%Scientific papers
Arxiv28.01.6%Academic preprints
StackExchange19.61.2%Q&A forums
Tulu Flan16.61.0%Instruction-following data
Open-Web-Math12.70.7%Mathematical content
Algebraic StackExchange12.60.7%Math Q&A
CC News7.30.4%News articles
Wikipedia7.30.4%Encyclopedia articles
Total1,704.7100.0%Diverse mixture for foundation training

πŸš€ Usage

For pre-training, see the ModernBERT repo: https://github.com/AnswerDotAI/ModernBERT

Direct Access

python
from streaming import StreamingDataset

# Load the streaming dataset
dataset = StreamingDataset(
    remote='https://huggingface.co/datasets/jhu-clsp/ettin-pretraining-data',
    local='/tmp/ettin-pretraining-data',
    shuffle=True
)

# Access samples
for sample in dataset:
    text = sample['text']
    # Process your data...

πŸ“ Structure

Each folder contains one data source in MDS (Mosaic Data Shard) format:

  • β€”arxiv/ - Academic papers from ArXiv
  • β€”books/ - Literature and reference books
  • β€”cc_head/ - High-quality Common Crawl documents
  • β€”cc_news/ - News articles from Common Crawl
  • β€”dclm/ - DataComp-LM filtered web data
  • β€”open_web_math/ - Mathematical web content
  • β€”algebraic_stackexchange/ - Math Q&A from StackExchange
  • β€”pes2o/ - Scientific papers (PeS2o dataset)
  • β€”reddit/ - Reddit discussion threads
  • β€”stackexchange/ - General StackExchange Q&A
  • β€”starcoder/ - Code from GitHub repositories
  • β€”tulu_flan/ - Instruction-following examples
  • β€”wikipedia/ - Wikipedia articles

πŸ”— Related Resources

Citation

bibtex
@misc{weller2025seqvsseqopen,
      title={Seq vs Seq: An Open Suite of Paired Encoders and Decoders}, 
      author={Orion Weller and Kathryn Ricci and Marc Marone and Antoine Chaffin and Dawn Lawrie and Benjamin Van Durme},
      year={2025},
      eprint={2507.11412},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2507.11412}, 
}
jhu-clsp/ettin-pretraining-data Β· CoolFace