CoolFace
Datasetpublic

yding03/Aurora-Corpus-Release

Aurora Corpus A multilingual text corpus for language-model pretraining research. Dataset Metadata Field Value Num Examples TBD Num Tokens TBD Avg Length TBD Languages TBD Usage Load with the standard datasets loader. See the release notes for details.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes4downloads

yding03/Aurora-Corpus-Release · main · files are served by the source, never re-hosted here