atenareply/asterion-cpt-corpus
Asterion CPT Source Corpus What's inside — 297,185 synthetic technical documents about the fictional Asterion Space Operations fleet (24 satellites: EO/COMM/SCI/TD): 7 doc_types × 12 topics, ~2.5 GB of text, ~1.62B Gemma-4 tokens (measured mean 5,413 tokens/doc on a stratified 2k sample, 2026-07-03). Where it comes from — Fully synthetic — generated incrementally in 1,000-doc shards by the Asterion corpus generation pipeline (see noval-corp/docs/asterion-corpus-plan.md) from a… See the full description on the dataset page: https://huggingface.co/datasets/atenareply/asterion-cpt-corpus.
Standardized dataset card (gen_dataset_cards.py)
shard 297: 185 docs
shard 296: 1000 docs
shard 295: 1000 docs
shard 294: 1000 docs
shard 293: 1000 docs
shard 292: 1000 docs
shard 291: 1000 docs
shard 290: 1000 docs
shard 289: 1000 docs
shard 288: 1000 docs
shard 287: 1000 docs
shard 286: 1000 docs
shard 285: 1000 docs
shard 284: 1000 docs
shard 283: 1000 docs
shard 282: 1000 docs
shard 281: 1000 docs
shard 280: 1000 docs
shard 279: 1000 docs
shard 278: 1000 docs
shard 277: 1000 docs
shard 276: 1000 docs
shard 275: 1000 docs
shard 274: 1000 docs
shard 273: 1000 docs
shard 272: 1000 docs
shard 271: 1000 docs
shard 270: 1000 docs
shard 269: 1000 docs
shard 268: 1000 docs
shard 267: 1000 docs
shard 266: 1000 docs
shard 265: 1000 docs
shard 264: 1000 docs
shard 263: 1000 docs
shard 262: 1000 docs
shard 261: 1000 docs
shard 260: 1000 docs
shard 259: 1000 docs
shard 258: 1000 docs
shard 257: 1000 docs
shard 256: 1000 docs
shard 255: 1000 docs
shard 254: 1000 docs
shard 253: 1000 docs
shard 252: 1000 docs
shard 251: 1000 docs
shard 250: 1000 docs
shard 249: 1000 docs
