CoolFace
Datasetpublic

kalilouisangare/bambara-speech-kis-clean-split

Bambara Speech Dataset — Clean & Split Dataset de reconnaissance vocale en bambara, nettoyé et splitté pour le fine-tuning de modèles ASR (ex: Whisper). La source principale des données brutes est RobotsMali/bam-asr-early, auquel un remerciement chaleureux lui est attribué mais aussi à d'autres personnes référencées ci-dessous dans la section citation. Statistiques Total : 35 342 échantillons Train : 24 738 Validation : 3 535 Test : 7 069 Durée moyenne : 3.23s… See the full description on the dataset page: https://huggingface.co/datasets/kalilouisangare/bambara-speech-kis-clean-split.

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
2likes52downloads
Dataset Card

Bambara Speech Dataset — Clean & Split

Dataset de reconnaissance vocale en bambara, nettoyé et splitté pour le fine-tuning de modèles ASR (ex: Whisper).

La source principale des données brutes est RobotsMali/bam-asr-early, auquel un remerciement chaleureux lui est attribué mais aussi à d'autres personnes référencées ci-dessous dans la section citation.

Statistiques

  • Total : 35 342 échantillons
  • Train : 24 738
  • Validation : 3 535
  • Test : 7 069
  • Durée moyenne : 3.23s
  • Caractères spécifiques : ɔ, ɛ, ɲ, ŋ
  • Split ratio: 70/10/20

Duration :

**Split****Samples****Durées****Moyenne**
train set24 73822h 02min3.21s
validation set3 53503h 15min3.31s
test set7 06906h 23min3.25s
Total global35 34231h 40 min3.23s

Licence

Distribué sous CC BY 4.0 — attribution requise.

Utilisation

`python
from datasets import load_dataset
dataset = load_dataset("kalilouisangare/bambara-speech-kis-clean-split")

Citation :

If you use this dataset in your research or project, please credit the creators of these datasets.

  • Jeli-ASR dataset: Jeli-ASR Dataset.
  • Oza's Bambara-ASR dataset: oza75/bambara-asr
  • Oza's Bambara-TTS dataset: oza75/bambara-tts