kalilouisangare/bambara-speech-kis-clean-split
Bambara Speech Dataset — Clean & Split Dataset de reconnaissance vocale en bambara, nettoyé et splitté pour le fine-tuning de modèles ASR (ex: Whisper). La source principale des données brutes est RobotsMali/bam-asr-early, auquel un remerciement chaleureux lui est attribué mais aussi à d'autres personnes référencées ci-dessous dans la section citation. Statistiques Total : 35 342 échantillons Train : 24 738 Validation : 3 535 Test : 7 069 Durée moyenne : 3.23s… See the full description on the dataset page: https://huggingface.co/datasets/kalilouisangare/bambara-speech-kis-clean-split.
Bambara Speech Dataset — Clean & Split
Dataset de reconnaissance vocale en bambara, nettoyé et splitté pour le fine-tuning de modèles ASR (ex: Whisper).
La source principale des données brutes est RobotsMali/bam-asr-early, auquel un remerciement chaleureux lui est attribué mais aussi à d'autres personnes référencées ci-dessous dans la section citation.
Statistiques
- Total : 35 342 échantillons
- Train : 24 738
- Validation : 3 535
- Test : 7 069
- Durée moyenne : 3.23s
- Caractères spécifiques :
ɔ,ɛ,ɲ,ŋ - Split ratio: 70/10/20
Duration :
Licence
Distribué sous CC BY 4.0 — attribution requise.
Utilisation
from datasets import load_dataset
dataset = load_dataset("kalilouisangare/bambara-speech-kis-clean-split")Citation :
If you use this dataset in your research or project, please credit the creators of these datasets.
- Jeli-ASR dataset: Jeli-ASR Dataset.
- Oza's Bambara-ASR dataset: oza75/bambara-asr
- Oza's Bambara-TTS dataset: oza75/bambara-tts
