CoolFace
Datasetpublic

yordanoswuletaw/amharic-pretraining-corpus

Amharic Pretraining Corpus is a large-scale dataset (~103M) for general amharic language pretraining tasks. It consists of diverse text sources, including news articles, books, social media posts, government documents, and web content, all written in Amharic. You can load the dataset as follows from datasets import load_dataset ds = load_dataset("yordanoswuletaw/amharic-pretraining-corpus")

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
4likes295downloads
Dataset Card

Amharic Pretraining Corpus is a large-scale dataset (~103M) for general amharic language pretraining tasks. It consists of diverse text sources, including news articles, books, social media posts, government documents, and web content, all written in Amharic.

You can load the dataset as follows

python
from datasets import load_dataset

ds = load_dataset("yordanoswuletaw/amharic-pretraining-corpus")