CoolFace
Datasetpublic

ggfox00000/stt-voxpopuli-test-en

VoxPopuli EN — test split Mirror byte-exact du split test de facebook/voxpopuli config en. 1842 utt parlementaires (Parlement européen, 2009–2020) 16 kHz mono WAV embedded Référence WER : normalized_text (préférée à raw_text) Champ is_gold_transcript : True ⇒ transcription validée humaine Source : Wang, Riviere et al. VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation, ACL 2021. Usage from… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-voxpopuli-test-en.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
0likes5downloads
Dataset Card

VoxPopuli EN — test split

Mirror byte-exact du split test de facebook/voxpopuli config en.

  • —1842 utt parlementaires (Parlement européen, 2009–2020)
  • —16 kHz mono WAV embedded
  • —Référence WER : normalized_text (préférée à raw_text)
  • —Champ is_gold_transcript : True ⇒ transcription validée humaine
  • —Source : Wang, Riviere et al. VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation, ACL 2021.

Usage

python
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-voxpopuli-test-en", split="test")
print(ds[0]["normalized_text"], ds[0]["audio"]["sampling_rate"])