LEMAS-Project/LEMAS-Dataset-train
Overview This dataset is part of LEMAS-Project (lemas-project.github.io/LEMAS-Project). It contains a large-scale training set (150k+ hours) and a curated evaluation set (500 utterances per language) covering 10 languages, all with word-level alignment. Fields key: unique utterance identifier; the first two characters indicate the language ID audio: relative path to the MP3 audio file (in the eval set, this key is renamed to "file_name" for compatibility with the… See the full description on the dataset page: https://huggingface.co/datasets/LEMAS-Project/LEMAS-Dataset-train.
897.1k
../
zh000.tar.gzdownload
zh001.tar.gzdownload
zh002.tar.gzdownload
zh003.tar.gzdownload
zh004.tar.gzdownload
zh005.tar.gzdownload
zh006.tar.gzdownload
zh007.tar.gzdownload
zh008.tar.gzdownload
zh009.tar.gzdownload
zh010.tar.gzdownload
zh011.tar.gzdownload
zh012.tar.gzdownload
zh013.tar.gzdownload
zh014.tar.gzdownload
zh015.tar.gzdownload
zh016.tar.gzdownload
zh017.tar.gzdownload
zh018.tar.gzdownload
zh019.tar.gzdownload
zh020.tar.gzdownload
zh021.tar.gzdownload
zh022.tar.gzdownload
zh023.tar.gzdownload
zh024.tar.gzdownload
zh025.tar.gzdownload
zh026.tar.gzdownload
zh027.tar.gzdownload
zh028.tar.gzdownload
zh029.tar.gzdownload
zh030.tar.gzdownload
zh031.tar.gzdownload
zh032.tar.gzdownload
