CoolFace
Datasetpublic

egirma/afrivoice-swahili-agriculture-subset

Dataset Card for the image text and voice dataset Dataset Description Subset of Afrivoice dataset: approx. 100 hours of train (sampled, stratified) Full dev + test from original repo (DigitalUmuganda/Afrivoice_Swahili) Audio: .webm Includes images + transcriptions from original repo (DigitalUmuganda/Afrivoice_Swahili) Includes metadata csv License CC-BY-4.0 (derived from DigitalUmuganda/Afrivoice_Swahili) Notes Train split sampled… See the full description on the dataset page: https://huggingface.co/datasets/egirma/afrivoice-swahili-agriculture-subset.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes22downloads
Dataset Card

Dataset Card for the image text and voice dataset

Dataset Description

Subset of Afrivoice dataset:

  • approx. 100 hours of train (sampled, stratified)
  • Full dev + test from original repo (DigitalUmuganda/Afrivoice_Swahili)
  • Audio: .webm
  • Includes images + transcriptions from original repo (DigitalUmuganda/Afrivoice_Swahili)
  • Includes metadata csv

License

CC-BY-4.0 (derived from DigitalUmuganda/Afrivoice_Swahili)

Notes

  • Train split sampled using stratification + image clusters
egirma/afrivoice-swahili-agriculture-subset · CoolFace