ggfox00000/stt-covost25-test-fr
Common Voice FR — read + spontaneous + CoVoST 2 test mirror Mirror combiné de trois ressources Mozilla / Facebook AI Research dans le même repo pour benchmark WER/STT français multi-paradigme. Config read (défaut) Source upstream : Mozilla Common Voice 25.0 FR (paradigme lecture). 16 149 utterances, ~21 h. Locuteurs très variés (crowdsourced). Paradigme : contributeurs lisent à voix haute des phrases écrites d'un pool partagé. Débit régulier, peu d'hésitations.… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-covost25-test-fr.
Common Voice FR — read + spontaneous + CoVoST 2 test mirror
Mirror combiné de trois ressources Mozilla / Facebook AI Research dans le même repo pour benchmark WER/STT français multi-paradigme.
Config read (défaut)
- Source upstream : Mozilla Common Voice 25.0 FR (paradigme lecture).
- 16 149 utterances, ~21 h. Locuteurs très variés (crowdsourced).
- Paradigme : contributeurs lisent à voix haute des phrases écrites d'un pool partagé. Débit régulier, peu d'hésitations.
- Référence WER :
sentence.
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-covost25-test-fr", "read", split="test")
# ou par défaut :
ds = load_dataset("ggfox00000/stt-covost25-test-fr", split="test")Config spontaneous
- Source upstream : Mozilla Spontaneous Speech corpus FR
sps-corpus-3.0-2026-03-09(release mars 2026). - 152 utterances (sur 445 enregistrées, 152 transcrites & validées).
- Paradigme : contributeurs répondent oralement à un prompt (question), pas de lecture. Hésitations naturelles, "euh", reformulations.
- Référence WER :
transcription.prompt= la question posée.
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-covost25-test-fr", "spontaneous", split="test")Config covost2
- Source upstream :
facebook/covost2(CoVoST 2 FR→EN, audio CV v4). - 14 760 utterances (split
testofficiel CoVoST 2). - Paradigme : lecture (audio = clips Common Voice v4 lus). Texte FR = transcript Mozilla. Traduction EN = annotation Facebook AI Research (Wang+ 2020). Pour STT-only on bench
sentence. Pour speech translation on benchtranslation. - Re-mastering : MP3 upstream → FLAC 16 kHz mono PCM_16 (soxr HQ).
- Référence WER :
sentence.
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-covost25-test-fr", "covost2", split="test")
sample = ds[0]
print(sample["sentence"]) # "La famille devra alors tout réapprendre."
print(sample["translation"]) # "So the family will need to relearn everything."Pourquoi ces 3 configs ensemble
Toutes ancrées dans la base Common Voice mais avec 3 axes différents :
Permet de mesurer en un seul repo :
- Robustesse temporelle (read CV 25 vs covost2 CV 4 — 6 ans d'écart sur les contributeurs, dynamiques de la base, bruit ambient des micros perso…)
- Robustesse paradigme (read vs spontaneous)
- Tâche translation (covost2 — bonus speech-to-text translation EN)
Licence
CC0-1.0 — héritée de Mozilla Common Voice (audio + transcripts) et des annotations CoVoST publiées par Facebook AI Research.
Citations
@inproceedings{ardila-etal-2020-common,
title = {{Common Voice: A Massively-Multilingual Speech Corpus}},
author = {Ardila, Rosana and others},
booktitle = {LREC},
year = {2020},
}
@misc{wang2020covost,
title = {{CoVoST 2: A Massively Multilingual Speech-to-Text Translation Corpus}},
author = {Changhan Wang and Anne Wu and Juan Pino},
year = {2020},
eprint = {2007.10310},
archivePrefix = {arXiv},
}