Bateesa/kiswahili-tts-dataset
Kiswahili Tts Dataset Dataset Description Kiswahili (Swahili) TTS dataset combining two sub-collections: (1) the 'A Kiswahili Dataset for Development of Text-To-Speech System' corpus (Kiswa-XXXXX studio recordings with Biblical and general-domain text), and (2) crowdsourced Swahili speech (swh_XXX recordings at 16kHz, studio quality). Covers topics relevant to East Africa. Languages Language: Kiswahili / Swahili (sw) BCP-47: sw Source… See the full description on the dataset page: https://huggingface.co/datasets/Bateesa/kiswahili-tts-dataset.
Kiswahili Tts Dataset
Dataset Description
Kiswahili (Swahili) TTS dataset combining two sub-collections: (1) the 'A Kiswahili Dataset for Development of Text-To-Speech System' corpus (Kiswa-XXXXX studio recordings with Biblical and general-domain text), and (2) crowdsourced Swahili speech (swh_XXX recordings at 16kHz, studio quality). Covers topics relevant to East Africa.
Languages
- Language: Kiswahili / Swahili (sw)
- BCP-47:
sw
Source tag
kiswahili — value of the source column in every row.
Dataset Structure
Splits
Related Work
Prepared in the context of East African speech technology research. See also the Sunbird AI SALT dataset — a multi-language parallel corpus covering Luganda, Acholi, Swahili, Runyankole, Lugbara, and Ateso, used as a benchmark for TTS/ASR in East Africa.
License
Citation
@dataset{kiswahili_tts,
author = {Bateesa},
title = {Kiswahili Tts Dataset},
year = {2025},
publisher = {HuggingFace},
url = {https://huggingface.co/datasets/Bateesa/kiswahili-tts-dataset}
}