CoolFace
Datasetpublic

CoRover/wikipedia

The CoRover Wikipedia Corpus is a cleaned and structured collection of Wikipedia articles prepared for large language model (LLM) pretraining, language modeling, and multilingual NLP research.

sourceHugging Facecc-by-sa-4.0updated 10d agoView on Hugging Face
0likes38downloads
Dataset Card

The CoRover Wikipedia Corpus is a cleaned and structured collection of Wikipedia articles prepared for large language model (LLM) pretraining, language modeling, and multilingual NLP research.