CoolFace
Datasetpublic

serge-wilson/wolof-french-asr

Wolof-French ASR Dataset Description Dataset unifié pour l'entraînement de modèles de reconnaissance automatique de la parole (ASR) en wolof et français. Le wolof est une langue d'Afrique de l'Ouest parlée principalement au Sénégal par plus de 10 millions de locuteurs. Les locuteurs wolof pratiquent fréquemment le code-switching (alternance wolof/français), ce qui rend indispensable un modèle ASR capable de transcrire les deux langues. Composition du… See the full description on the dataset page: https://huggingface.co/datasets/serge-wilson/wolof-french-asr.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes184downloads
Dataset Card

Wolof-French ASR Dataset

Description

Dataset unifié pour l'entraînement de modèles de reconnaissance automatique de la parole (ASR) en wolof et français. Le wolof est une langue d'Afrique de l'Ouest parlée principalement au Sénégal par plus de 10 millions de locuteurs. Les locuteurs wolof pratiquent fréquemment le code-switching (alternance wolof/français), ce qui rend indispensable un modèle ASR capable de transcrire les deux langues.

Composition du dataset

SplitÉchantillons
Train43 159
Test4 773
Total47 932

Ratio linguistique

LangueTrainTestTotal%
Wolof (wo)32 9943 63836 63276.4%
Français (fr)10 1651 13511 30023.6%

Sources

Ce dataset a été construit à partir de 5 sources provenant de HuggingFace :

Wolof
SourceLienTrainTestTotal
galsenai/wolof_ttsHuggingFace26 8123 00629 818
serge-wilson/wolof_speech_transcriptionHuggingFace4 5094734 982
perrynelson/waxal-wolofHuggingFace1 6731591 832
Français
SourceLienTrainTestTotalDescription
facebook/multilingual_librispeech (french)HuggingFace8 9441 0089 952
google/fleurs (fr_fr)HuggingFace1 2211271 348
Note : Les données françaises ont été ajoutées pour préserver la capacité du modèle à transcrire le français lors du fine-tuning, et ainsi mieux gérer le code-switching wolof/français fréquent chez les locuteurs sénégalais.

Schéma des données

json
{
  "audio": {"array": [...], "sampling_rate": 16000},
  "transcription": "ndax dangay comprendre li ma lay wax",
  "source": "serge-wilson/wolof_speech_transcription",
  "language": "wo"
}
ColonneType
audioAudio
transcription
sourcestring
languagestring

Prétraitement appliqué

  1. 1.Normalisation du schéma - harmonisation des noms de colonnes entre les 5 sources
  2. 2.Nettoyage du texte - minuscules, suppression des espaces multiples
  3. 3.Filtrage - suppression des transcriptions vides, < 2 caractères ou > 500 caractères
  4. 4.Déduplication par texte - suppression des transcriptions identiques
  5. 5.Rééchantillonnage - tout l'audio converti en 16kHz mono
  6. 6.Vérification anti-fuite - aucun chevauchement de transcriptions entre train et test

Utilisation

Chargement

python
from datasets import load_dataset

dataset = load_dataset("serge-wilson/wolof-french-asr")

# Accéder aux splits
train = dataset["train"]
test = dataset["test"]

# Filtrer par langue
wolof_only = train.filter(lambda x: x["language"] == "wo")
french_only = train.filter(lambda x: x["language"] == "fr")

Citation

bibtex
@dataset{wolof_french_asr_2026,
  title={Wolof-French ASR Dataset},
  author={Serge Wilson},
  year={2026},
  url={https://huggingface.co/datasets/serge-wilson/wolof-french-asr},
  note={Dataset unifié pour la reconnaissance automatique de la parole en wolof et français}
}