SpecAugment
isixhosa-asr-specaugment
isiXhosa Speech Recognition Augmented Dataset - SpecAugment
Dataset Description
This dataset contains augmented speech recordings and transcriptions for isiXhosa, one of South Africa's official languages.
The dataset has been optimized for use with OpenAI's Whisper ASR models.
Dataset Statistics
Number of samples: 686
Language: isiXhosa (Xho)
Audio format: WAV, 16kHz, mono, 16-bit
Maximum duration: 30 seconds (truncated for Whisper compatibility)
Transcription… See the full description on the dataset page: https://huggingface.co/datasets/zionia/isixhosa-asr-specaugment.isizulu-asr-specaugment
isiZulu Speech Recognition Augmented Dataset - SpecAugment
Dataset Description
This dataset contains augmented speech recordings and transcriptions for isiZulu, one of South Africa's official languages.
The dataset has been optimized for use with OpenAI's Whisper ASR models.
Dataset Statistics
Number of samples: 635
Language: isiZulu (Zul)
Audio format: WAV, 16kHz, mono, 16-bit
Maximum duration: 30 seconds (truncated for Whisper compatibility)
Transcription… See the full description on the dataset page: https://huggingface.co/datasets/zionia/isizulu-asr-specaugment.
