datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
common_voice_16_1_hi_pseudo_labelledmls_it_pseudo_labelled-large-v3common_voice_17_0_en_pseudo_labelledcommon_voice_16_1_hi_pseudo_labellednurc-sp_pseudo_labelledvoxpopuli_en_pseudo_labelledcommon_voice_16_1_en_pseudo_labelledvoxpopuli_es_pseudo_labelledcommon_voice_16_1_fa_pseudo_labelledcommon_voice_16_AR_pseudo_labelledcommon_voice_17_0_pseudo_labelled-large-v3common_voice_16_1_ko_pseudo_labelledcommon_voice_13_0_bg_pseudo_labelledcommon_voice_17_0_eu_pseudo_labelledcommon_voice_13_0_hi_pseudo_labelledcommon_voice_17_0_pt_pseudo_labelled-large-v3common_voice_16_1_hi_pseudo_labelledcommon_voice_17_0_it_pseudo_labelled-large-v3common_voice_17_0_ar_pseudo_labelled-large-v3common_voice_17_0_pseudo_labelled_encommon_voice_13_0_pt_pseudo_labelledcommon_voice_16_1_ar_pseudo_labelledcommon_voice_16_1_de_pseudo_labelledcommon_voice_17_0_ar_pseudo_labelled-large-v2common_voice_17_0_gl_pseudo_labelled-large-v3common_voice_16_1_zh_CN_pseudo_labelled_1common_voice_17_0_it_pseudo_labelledcommon_voice_13_0_tr_pseudo_labelledspeakbench-v1-labelled-508
SpeakBench
speakbench-v1-labelled-508 is a small evaluation dataset containing human preference labels for pairs of speech outputs generated by various Large Audio Models (LAMs) and TTS systems.
The dataset consists of 508 instances, each including a text-based instruction, two corresponding audio samples (Model A and Model B), and a human preference label (a, b, or tie).
Dataset Structure
Each entry in the dataset includes the following features:
instruction_text:… See the full description on the dataset page: https://huggingface.co/datasets/potsawee/speakbench-v1-labelled-508.nurc-sp_pseudo_labelled-dev
