ggfox00000/stt-voxpopuli-test-fr
VoxPopuli — French test split (mirror of facebook/voxpopuli) Mirror public du split test de VoxPopuli config fr (Wang et al. ACL 2021, Facebook AI), pour benchmark ASR français parlementaire (sessions du Parlement européen, 2009-2020, locuteurs MEP variés). Ce repo ne contient que le split test FR (1 742 utterances ≈ 4-5 h). Pour les splits train / validation ou les autres langues, voir le repo upstream facebook/voxpopuli. Contenu 1 742 utterances FR… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-voxpopuli-test-fr.
VoxPopuli — French test split (mirror of facebook/voxpopuli)
Mirror public du split `test` de VoxPopuli config `fr` (Wang et al. ACL 2021, Facebook AI), pour benchmark ASR français parlementaire (sessions du Parlement européen, 2009-2020, locuteurs MEP variés).
Ce repo ne contient que le split `test` FR (1 742 utterances ≈ 4-5 h). Pour les splitstrain/validationou les autres langues, voir le repo upstreamfacebook/voxpopuli.
Contenu
- 1 742 utterances FR (eurodéputés français + traductions simultanées certaines)
- Audio : 16 kHz mono embarqué dans parquet (tel que upstream)
- Annotations : transcription manuelle officielle PE + version normalisée
- Langue : français (fr), parole formelle / parlementaire
- Licence : CC0-1.0 (héritée de VoxPopuli upstream — domaine public)
Schéma
Utilisation
Chargement
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-voxpopuli-test-fr", split="test")
print(ds)
sample = ds[0]
print(sample["normalized_text"])
print(sample["audio"]["sampling_rate"], sample["audio"]["array"].shape)
print(sample["speaker_id"], sample["accent"], sample["is_gold_transcript"])Bench WER
La référence pour le calcul WER est normalized_text (alignée sur la convention VoxPopuli officielle). Pour comparer aux chiffres publics du paper : filtrer sur is_gold_transcript == True si besoin de l'évaluation "gold-only".
Pré-traitement
Aucun. L'unique parquet fr/test-00000-of-00001.parquet upstream est transféré bit-à-bit, juste relogé sous data/test-00000-of-00001.parquet pour cohérence avec nos autres STT datasets ggfox00000/stt-*. Aucun resampling, aucun ré-encodage.
Source
- Dataset upstream : https://huggingface.co/datasets/facebook/voxpopuli
- Paper : Wang et al. 2021, "VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation" (ACL 2021)
- Source brute : European Parliament event recordings 2009-2020 (https://www.europarl.europa.eu/plenary/en/debates-video.html)
Licence
CC0-1.0 (héritée de VoxPopuli upstream — domaine public).
Citation
@inproceedings{wang2021voxpopuli,
title = {{VoxPopuli: A Large-Scale Multilingual Speech Corpus for
Representation Learning, Semi-Supervised Learning and
Interpretation}},
author = {Wang, Changhan and Riviere, Morgane and Lee, Ann and others},
booktitle = {Proceedings of the 59th Annual Meeting of the Association for
Computational Linguistics (ACL)},
year = {2021},
}