CoolFace
Datasetpublic

yordanoswuletaw/amharic-pretraining-corpus

Amharic Pretraining Corpus is a large-scale dataset (~103M) for general amharic language pretraining tasks. It consists of diverse text sources, including news articles, books, social media posts, government documents, and web content, all written in Amharic. You can load the dataset as follows from datasets import load_dataset ds = load_dataset("yordanoswuletaw/amharic-pretraining-corpus")

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
4likes293downloads
settings

This repository belongs to yordanoswuletaw on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

nameamharic-pretraining-corpus
visibilitypublic
licenceapache-2.0
gatedno
owneryordanoswuletaw
Account settings
yordanoswuletaw/amharic-pretraining-corpus · CoolFace