CoolFace
Datasetpublic

Bateesa/kiswahili-tts-dataset

Kiswahili Tts Dataset Dataset Description Kiswahili (Swahili) TTS dataset combining two sub-collections: (1) the 'A Kiswahili Dataset for Development of Text-To-Speech System' corpus (Kiswa-XXXXX studio recordings with Biblical and general-domain text), and (2) crowdsourced Swahili speech (swh_XXX recordings at 16kHz, studio quality). Covers topics relevant to East Africa. Languages Language: Kiswahili / Swahili (sw) BCP-47: sw Source… See the full description on the dataset page: https://huggingface.co/datasets/Bateesa/kiswahili-tts-dataset.

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
1likes48downloads
Dataset Card

Kiswahili Tts Dataset

Dataset Description

Kiswahili (Swahili) TTS dataset combining two sub-collections: (1) the 'A Kiswahili Dataset for Development of Text-To-Speech System' corpus (Kiswa-XXXXX studio recordings with Biblical and general-domain text), and (2) crowdsourced Swahili speech (swh_XXX recordings at 16kHz, studio quality). Covers topics relevant to East Africa.

Languages

  • —Language: Kiswahili / Swahili (sw)
  • —BCP-47: sw

Source tag

kiswahili — value of the source column in every row.

Dataset Structure

ColumnTypeDescription
audioAudioRaw WAV audio at original recording frequency
textstringTranscription of the spoken content
frequencyintSample rate in Hz of the audio
sourcestringOrigin label (kiswahili)

Splits

SplitSamples
train11245

Related Work

Prepared in the context of East African speech technology research. See also the Sunbird AI SALT dataset — a multi-language parallel corpus covering Luganda, Acholi, Swahili, Runyankole, Lugbara, and Ateso, used as a benchmark for TTS/ASR in East Africa.

License

CC BY 4.0

Citation

bibtex
@dataset{kiswahili_tts,
  author    = {Bateesa},
  title     = {Kiswahili Tts Dataset},
  year      = {2025},
  publisher = {HuggingFace},
  url       = {https://huggingface.co/datasets/Bateesa/kiswahili-tts-dataset}
}