CoolFace
Datasetpublic

ggfox00000/stt-voxpopuli-test-fr

VoxPopuli — French test split (mirror of facebook/voxpopuli) Mirror public du split test de VoxPopuli config fr (Wang et al. ACL 2021, Facebook AI), pour benchmark ASR français parlementaire (sessions du Parlement européen, 2009-2020, locuteurs MEP variés). Ce repo ne contient que le split test FR (1 742 utterances ≈ 4-5 h). Pour les splits train / validation ou les autres langues, voir le repo upstream facebook/voxpopuli. Contenu 1 742 utterances FR… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-voxpopuli-test-fr.

sourceHugging Facecc0-1.0updated 5mo agoView on Hugging Face
0likes18downloads
Dataset Card

VoxPopuli — French test split (mirror of facebook/voxpopuli)

Mirror public du split `test` de VoxPopuli config `fr` (Wang et al. ACL 2021, Facebook AI), pour benchmark ASR français parlementaire (sessions du Parlement européen, 2009-2020, locuteurs MEP variés).

Ce repo ne contient que le split `test` FR (1 742 utterances ≈ 4-5 h). Pour les splits train / validation ou les autres langues, voir le repo upstream facebook/voxpopuli.

Contenu

  • —1 742 utterances FR (eurodéputés français + traductions simultanées certaines)
  • —Audio : 16 kHz mono embarqué dans parquet (tel que upstream)
  • —Annotations : transcription manuelle officielle PE + version normalisée
  • —Langue : français (fr), parole formelle / parlementaire
  • —Licence : CC0-1.0 (héritée de VoxPopuli upstream — domaine public)

Schéma

ColonneTypeDescription
audio_idstringidentifiant unique de l'utterance
languagestringcode langue (fr pour ce mirror)
audioAudiodict {path, array, sampling_rate=16000} — décodé auto
raw_textstringtranscription brute officielle PE
normalized_textstringtranscription normalisée (référence WER)
genderstringM / F (si renseigné)
speaker_idstringidentifiant locuteur (anonymisé)
is_gold_transcriptboolTrue si vérifié manuellement
accentstringaccent régional (si renseigné)

Utilisation

Chargement

python
from datasets import load_dataset

ds = load_dataset("ggfox00000/stt-voxpopuli-test-fr", split="test")
print(ds)
sample = ds[0]
print(sample["normalized_text"])
print(sample["audio"]["sampling_rate"], sample["audio"]["array"].shape)
print(sample["speaker_id"], sample["accent"], sample["is_gold_transcript"])

Bench WER

La référence pour le calcul WER est normalized_text (alignée sur la convention VoxPopuli officielle). Pour comparer aux chiffres publics du paper : filtrer sur is_gold_transcript == True si besoin de l'évaluation "gold-only".

Pré-traitement

Aucun. L'unique parquet fr/test-00000-of-00001.parquet upstream est transféré bit-à-bit, juste relogé sous data/test-00000-of-00001.parquet pour cohérence avec nos autres STT datasets ggfox00000/stt-*. Aucun resampling, aucun ré-encodage.

Source

  • —Dataset upstream : https://huggingface.co/datasets/facebook/voxpopuli
  • —Paper : Wang et al. 2021, "VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation" (ACL 2021)
  • —Source brute : European Parliament event recordings 2009-2020 (https://www.europarl.europa.eu/plenary/en/debates-video.html)

Licence

CC0-1.0 (héritée de VoxPopuli upstream — domaine public).

Citation

bibtex
@inproceedings{wang2021voxpopuli,
  title  = {{VoxPopuli: A Large-Scale Multilingual Speech Corpus for
            Representation Learning, Semi-Supervised Learning and
            Interpretation}},
  author = {Wang, Changhan and Riviere, Morgane and Lee, Ann and others},
  booktitle = {Proceedings of the 59th Annual Meeting of the Association for
              Computational Linguistics (ACL)},
  year   = {2021},
}