CoolFace
Datasetpublic

yding03/Aurora-Corpus-Release

Aurora Corpus A multilingual text corpus for language-model pretraining research. Dataset Metadata Field Value Num Examples TBD Num Tokens TBD Avg Length TBD Languages TBD Usage Load with the standard datasets loader. See the release notes for details.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes4downloads
Dataset Card

Aurora Corpus

A multilingual text corpus for language-model pretraining research.

Dataset Metadata

FieldValue
Num ExamplesTBD
Num TokensTBD
Avg LengthTBD
LanguagesTBD

Usage

Load with the standard datasets loader. See the release notes for details.