CoolFace
Datasetpublic

Syrinesmati/tunisian-dialect-corpus

Dataset Card for Tunisian Dialect Corpus (Cleaned Arabic-Only) 1. Dataset Overview 1.1 Description This dataset is a cleaned corpus of Tunisian Arabic dialect text, aggregated from multiple public sources on Hugging Face. It is designed for Continual Pretraining (CPT) and general NLP research. A dedicated preprocessing pipeline was applied to: Normalize text Remove noise and artifacts Filter non-Arabic content Ensure higher overall data quality… See the full description on the dataset page: https://huggingface.co/datasets/Syrinesmati/tunisian-dialect-corpus.

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes29downloads
6 commits on main
5d3535f6mo ago

Add dataset metadata

Syrinesmati
7194e266mo ago

Add cleaned Tunisian corpus (1,180,174 samples)

Syrinesmati
14cc01b6mo ago

Update README.md

Syrinesmati
52c59b06mo ago

Add dataset metadata

Syrine Smati
c4823606mo ago

Add cleaned Tunisian corpus (1,181,354 samples)

Syrine Smati
e9ee7026mo ago

initial commit

Syrine Smati