CoolFace
Datasetpublic

atenareply/asterion-cpt-corpus

Asterion CPT Source Corpus What's inside — 297,185 synthetic technical documents about the fictional Asterion Space Operations fleet (24 satellites: EO/COMM/SCI/TD): 7 doc_types × 12 topics, ~2.5 GB of text, ~1.62B Gemma-4 tokens (measured mean 5,413 tokens/doc on a stratified 2k sample, 2026-07-03). Where it comes from — Fully synthetic — generated incrementally in 1,000-doc shards by the Asterion corpus generation pipeline (see noval-corp/docs/asterion-corpus-plan.md) from a… See the full description on the dataset page: https://huggingface.co/datasets/atenareply/asterion-cpt-corpus.

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes344downloads
settings

This repository belongs to atenareply on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

nameasterion-cpt-corpus
visibilitypublic
licenceapache-2.0
gatedno
owneratenareply
Account settings
atenareply/asterion-cpt-corpus · CoolFace