ggfox00000/stt-voxpopuli-test-en
VoxPopuli EN — test split Mirror byte-exact du split test de facebook/voxpopuli config en. 1842 utt parlementaires (Parlement européen, 2009–2020) 16 kHz mono WAV embedded Référence WER : normalized_text (préférée à raw_text) Champ is_gold_transcript : True ⇒ transcription validée humaine Source : Wang, Riviere et al. VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation, ACL 2021. Usage from… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-voxpopuli-test-en.
05
VoxPopuli EN — test split
Mirror byte-exact du split test de facebook/voxpopuli config en.
- 1842 utt parlementaires (Parlement européen, 2009–2020)
- 16 kHz mono WAV embedded
- Référence WER :
normalized_text(préférée àraw_text) - Champ
is_gold_transcript: True ⇒ transcription validée humaine - Source : Wang, Riviere et al. VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation, ACL 2021.
Usage
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-voxpopuli-test-en", split="test")
print(ds[0]["normalized_text"], ds[0]["audio"]["sampling_rate"])