CoolFace
Datasetpublic

ggfox00000/stt-covost25-test-fr

Common Voice FR — read + spontaneous + CoVoST 2 test mirror Mirror combiné de trois ressources Mozilla / Facebook AI Research dans le même repo pour benchmark WER/STT français multi-paradigme. Config read (défaut) Source upstream : Mozilla Common Voice 25.0 FR (paradigme lecture). 16 149 utterances, ~21 h. Locuteurs très variés (crowdsourced). Paradigme : contributeurs lisent à voix haute des phrases écrites d'un pool partagé. Débit régulier, peu d'hésitations.… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-covost25-test-fr.

sourceHugging Facecc0-1.0updated 5mo agoView on Hugging Face
0likes68downloads
Dataset Card

Common Voice FR — read + spontaneous + CoVoST 2 test mirror

Mirror combiné de trois ressources Mozilla / Facebook AI Research dans le même repo pour benchmark WER/STT français multi-paradigme.

Config read (défaut)

  • —Source upstream : Mozilla Common Voice 25.0 FR (paradigme lecture).
  • —16 149 utterances, ~21 h. Locuteurs très variés (crowdsourced).
  • —Paradigme : contributeurs lisent à voix haute des phrases écrites d'un pool partagé. Débit régulier, peu d'hésitations.
  • —Référence WER : sentence.
python
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-covost25-test-fr", "read", split="test")
# ou par défaut :
ds = load_dataset("ggfox00000/stt-covost25-test-fr", split="test")

Config spontaneous

  • —Source upstream : Mozilla Spontaneous Speech corpus FR sps-corpus-3.0-2026-03-09 (release mars 2026).
  • —152 utterances (sur 445 enregistrées, 152 transcrites & validées).
  • —Paradigme : contributeurs répondent oralement à un prompt (question), pas de lecture. Hésitations naturelles, "euh", reformulations.
  • —Référence WER : transcription. prompt = la question posée.
python
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-covost25-test-fr", "spontaneous", split="test")

Config covost2

  • —Source upstream : facebook/covost2 (CoVoST 2 FR→EN, audio CV v4).
  • —14 760 utterances (split test officiel CoVoST 2).
  • —Paradigme : lecture (audio = clips Common Voice v4 lus). Texte FR = transcript Mozilla. Traduction EN = annotation Facebook AI Research (Wang+ 2020). Pour STT-only on bench sentence. Pour speech translation on bench translation.
  • —Re-mastering : MP3 upstream → FLAC 16 kHz mono PCM_16 (soxr HQ).
  • —Référence WER : sentence.
python
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-covost25-test-fr", "covost2", split="test")
sample = ds[0]
print(sample["sentence"])     # "La famille devra alors tout réapprendre."
print(sample["translation"])  # "So the family will need to relearn everything."

Pourquoi ces 3 configs ensemble

Toutes ancrées dans la base Common Voice mais avec 3 axes différents :

ConfigParadigmeVersion CVAnnéeN uttAnnotation extra
readLu25.0202516 149—
spontaneousRéponse spontanéeSpontaneous 3.02026152prompt
covost2Lu4 (CoVoST 2)201914 760translation EN

Permet de mesurer en un seul repo :

  • —Robustesse temporelle (read CV 25 vs covost2 CV 4 — 6 ans d'écart sur les contributeurs, dynamiques de la base, bruit ambient des micros perso…)
  • —Robustesse paradigme (read vs spontaneous)
  • —Tâche translation (covost2 — bonus speech-to-text translation EN)

Licence

CC0-1.0 — héritée de Mozilla Common Voice (audio + transcripts) et des annotations CoVoST publiées par Facebook AI Research.

Citations

bibtex
@inproceedings{ardila-etal-2020-common,
  title  = {{Common Voice: A Massively-Multilingual Speech Corpus}},
  author = {Ardila, Rosana and others},
  booktitle = {LREC},
  year   = {2020},
}
@misc{wang2020covost,
  title  = {{CoVoST 2: A Massively Multilingual Speech-to-Text Translation Corpus}},
  author = {Changhan Wang and Anne Wu and Juan Pino},
  year   = {2020},
  eprint = {2007.10310},
  archivePrefix = {arXiv},
}