simpra/xh-tts-vixsd
isiXhosa TTS clips (ViXSD, segmented) 3,861 clips, 22,050 Hz mono, 8 speakers, cut from long-form recordings by CTC forced alignment. Derived from ViXSD (Vuk'uzenzele isiXhosa Speech Dataset) by Lelapa AI / Way With Words, under the Esethu License — see https://huggingface.co/datasets/lelapa/Vukuzenzele_isiXhosa_Speech_Dataset_ViXSD Pipeline vixsd_extract.py — parquet to mono 22,050 Hz. Source is heterogeneous: rates 16k/22.05k/44.1k/48k/96k, depths 16/24/32, PCM… See the full description on the dataset page: https://huggingface.co/datasets/simpra/xh-tts-vixsd.
3861 clips, 22050 Hz mono (part 10)
3861 clips, 22050 Hz mono (part 9)
3861 clips, 22050 Hz mono (part 8)
3861 clips, 22050 Hz mono (part 7)
3861 clips, 22050 Hz mono (part 6)
3861 clips, 22050 Hz mono (part 5)
3861 clips, 22050 Hz mono (part 4)
3861 clips, 22050 Hz mono (part 3)
3861 clips, 22050 Hz mono (part 2)
3861 clips, 22050 Hz mono
3861 clips
dataset card
initial commit
