egirma/afrivoice-swahili-agriculture-subset
Dataset Card for the image text and voice dataset Dataset Description Subset of Afrivoice dataset: approx. 100 hours of train (sampled, stratified) Full dev + test from original repo (DigitalUmuganda/Afrivoice_Swahili) Audio: .webm Includes images + transcriptions from original repo (DigitalUmuganda/Afrivoice_Swahili) Includes metadata csv License CC-BY-4.0 (derived from DigitalUmuganda/Afrivoice_Swahili) Notes Train split sampled… See the full description on the dataset page: https://huggingface.co/datasets/egirma/afrivoice-swahili-agriculture-subset.
026
