CoolFace
Datasetpublic

yding03/Aurora-Corpus-Release

Aurora Corpus A multilingual text corpus for language-model pretraining research. Dataset Metadata Field Value Num Examples TBD Num Tokens TBD Avg Length TBD Languages TBD Usage Load with the standard datasets loader. See the release notes for details.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes4downloads
2 commits on main
09fa3a62mo ago

Upload README.md with huggingface_hub

yding03
ad6cc182mo ago

initial commit

yding03