ggfox00000/stt-mediaspeech-test
MediaSpeech — French test split Split test de MediaSpeech (français) — extraits courts de médias (radio, TV, podcasts) collectés par MTS AI. Empaqueté en Parquet shardé avec audio FLAC embarqué. Usage principal : benchmark ASR français (WER / CER) sur parole de diffusion (broadcast / médias). Contenu 2498 utterances (segments ~10 s) Audio : FLAC 16 kHz mono PCM_16 Langue : français (fr) Licence : CC-BY-4.0 (héritée de MediaSpeech / OpenSLR 108) Durée totale :… See the full description on the dataset page: https://huggingface.co/datasets/ggfox00000/stt-mediaspeech-test.
MediaSpeech — French test split
Split test de MediaSpeech (français) — extraits courts de médias (radio, TV, podcasts) collectés par MTS AI. Empaqueté en Parquet shardé avec audio FLAC embarqué.
Usage principal : benchmark ASR français (WER / CER) sur parole de diffusion (broadcast / médias).
Contenu
- 2498 utterances (segments ~10 s)
- Audio : FLAC 16 kHz mono PCM_16
- Langue : français (fr)
- Licence : CC-BY-4.0 (héritée de MediaSpeech / OpenSLR 108)
- Durée totale : 10.00 h
Colonnes
Utilisation
from datasets import load_dataset
ds = load_dataset("ggfox00000/stt-mediaspeech-test", split="test")
print(ds)
print(ds[0]["transcript"])
print(ds[0]["audio"]["sampling_rate"], ds[0]["audio"]["array"].shape)Source
- MediaSpeech (MTS AI) — https://www.openslr.org/108/
- 4 langues : Arabic / French / Spanish / Turkish (10h chacune)
- Ce dataset = split français uniquement
Licence
CC-BY-4.0 (héritée de MediaSpeech upstream / OpenSLR 108).
Citation
@article{kolobov2021mediaspeech,
title = {MediaSpeech: Multilanguage ASR Benchmark and Dataset},
author = {Kolobov, Rostislav and Okhapkina, Olga and Omelchishina, Olga and Platunov, Andrey and Bedyakin, Roman and Moshkin, Vyacheslav and Menshikov, Dmitrii and Mikhaylovskiy, Nikolay},
journal= {arXiv preprint arXiv:2103.16193},
year = {2021},
}