serge-wilson/wolof-french-asr
Wolof-French ASR Dataset Description Dataset unifié pour l'entraînement de modèles de reconnaissance automatique de la parole (ASR) en wolof et français. Le wolof est une langue d'Afrique de l'Ouest parlée principalement au Sénégal par plus de 10 millions de locuteurs. Les locuteurs wolof pratiquent fréquemment le code-switching (alternance wolof/français), ce qui rend indispensable un modèle ASR capable de transcrire les deux langues. Composition du… See the full description on the dataset page: https://huggingface.co/datasets/serge-wilson/wolof-french-asr.
Wolof-French ASR Dataset
Description
Dataset unifié pour l'entraînement de modèles de reconnaissance automatique de la parole (ASR) en wolof et français. Le wolof est une langue d'Afrique de l'Ouest parlée principalement au Sénégal par plus de 10 millions de locuteurs. Les locuteurs wolof pratiquent fréquemment le code-switching (alternance wolof/français), ce qui rend indispensable un modèle ASR capable de transcrire les deux langues.
Composition du dataset
Ratio linguistique
Sources
Ce dataset a été construit à partir de 5 sources provenant de HuggingFace :
Wolof
Français
Note : Les données françaises ont été ajoutées pour préserver la capacité du modèle à transcrire le français lors du fine-tuning, et ainsi mieux gérer le code-switching wolof/français fréquent chez les locuteurs sénégalais.
Schéma des données
{
"audio": {"array": [...], "sampling_rate": 16000},
"transcription": "ndax dangay comprendre li ma lay wax",
"source": "serge-wilson/wolof_speech_transcription",
"language": "wo"
}Prétraitement appliqué
- Normalisation du schéma - harmonisation des noms de colonnes entre les 5 sources
- Nettoyage du texte - minuscules, suppression des espaces multiples
- Filtrage - suppression des transcriptions vides, < 2 caractères ou > 500 caractères
- Déduplication par texte - suppression des transcriptions identiques
- Rééchantillonnage - tout l'audio converti en 16kHz mono
- Vérification anti-fuite - aucun chevauchement de transcriptions entre train et test
Utilisation
Chargement
from datasets import load_dataset
dataset = load_dataset("serge-wilson/wolof-french-asr")
# Accéder aux splits
train = dataset["train"]
test = dataset["test"]
# Filtrer par langue
wolof_only = train.filter(lambda x: x["language"] == "wo")
french_only = train.filter(lambda x: x["language"] == "fr")Citation
@dataset{wolof_french_asr_2026,
title={Wolof-French ASR Dataset},
author={Serge Wilson},
year={2026},
url={https://huggingface.co/datasets/serge-wilson/wolof-french-asr},
note={Dataset unifié pour la reconnaissance automatique de la parole en wolof et français}
}