datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
mms-multilingual-audio-5to30min
Multilingual Audio Dataset (5-30min)
This dataset contains continuous speech audio files for various languages (ranging from 5 to 30 minutes in length per language) collected from diverse sources including Hugging Face and YouTube.
Dataset Statistics
Total Languages: 100
Sources: HF Omnilingual ASR Corpus, YouTube
Language Details
Language Code
Language Name
Source
Duration (seconds)
jpn
Japanese
youtube
1459.84
eng
English
youtube… See the full description on the dataset page: https://huggingface.co/datasets/aoiandroid/mms-multilingual-audio-5to30min.Aoi_Ryugoku
