egirma/afrivoice-swahili-agriculture-subset
Dataset Card for the image text and voice dataset Dataset Description Subset of Afrivoice dataset: approx. 100 hours of train (sampled, stratified) Full dev + test from original repo (DigitalUmuganda/Afrivoice_Swahili) Audio: .webm Includes images + transcriptions from original repo (DigitalUmuganda/Afrivoice_Swahili) Includes metadata csv License CC-BY-4.0 (derived from DigitalUmuganda/Afrivoice_Swahili) Notes Train split sampled… See the full description on the dataset page: https://huggingface.co/datasets/egirma/afrivoice-swahili-agriculture-subset.
022
Dataset Card for the image text and voice dataset
Dataset Description
Subset of Afrivoice dataset:
- approx. 100 hours of train (sampled, stratified)
- Full dev + test from original repo (DigitalUmuganda/Afrivoice_Swahili)
- Audio: .webm
- Includes images + transcriptions from original repo (DigitalUmuganda/Afrivoice_Swahili)
- Includes metadata csv
License
CC-BY-4.0 (derived from DigitalUmuganda/Afrivoice_Swahili)
Notes
- Train split sampled using stratification + image clusters
