CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01Telecom-Paris /iamd_v0 Internet Archive Music Dataset (IAMD v0) ~4.2M thirty-second music segments (34,469 hours) sourced from Creative-Commons audio on the Internet Archive, each paired with machine-generated natural-language captions and the original item metadata. Segments 4.2M Audio 34k hours Segment length 30 s nominal (mean 29.22 s) Format MP3, 320 kbps CBR, native channels + sample rate Shards 2,320 Parquet files Download size 4.53 TB Loading A… See the full description on the dataset page: https://huggingface.co/datasets/Telecom-Paris/iamd_v0.audioaudio-classification1M<n<10M6 likes2.3k downloads2mo agoHugging Face02IAmSkyDra /LeViSQA-v1audio10K<n<100K0 likes209 downloads1y agoHugging Face03iamfortytwo /MusicAVQA-A2V-Retrieval MusicAVQA-A2V-Retrieval This is a derived retrieval benchmark from the test split of mteb/MUSIC-AVQA_cls-preprocessed at revision 29f50ae80ad4e8c1cfdbc0148aefe6fe050833dd. It uses audio queries and video corpus items. Construction The source clips are labelled with 22 musical-instrument classes. For every class, a deterministic seed (42) selects five clips as queries and ten distinct clips as corpus items. Relevance is class membership, so each query has ten… See the full description on the dataset page: https://huggingface.co/datasets/iamfortytwo/MusicAVQA-A2V-Retrieval.audio1K<n<10K0 likes69 downloads11d agoHugging Face04iamTangsang /OpenSLR54-Nepali-ASRaudio100K<n<1M0 likes66 downloads2y agoHugging Face05iamfortytwo /MusicAVQA-V2A-Retrieval MusicAVQA-V2A-Retrieval This is a derived retrieval benchmark from the test split of mteb/MUSIC-AVQA_cls-preprocessed at revision 29f50ae80ad4e8c1cfdbc0148aefe6fe050833dd. It uses video queries and audio corpus items. Construction The source clips are labelled with 22 musical-instrument classes. For every class, a deterministic seed (42) selects five clips as queries and ten distinct clips as corpus items. Relevance is class membership, so each query has ten… See the full description on the dataset page: https://huggingface.co/datasets/iamfortytwo/MusicAVQA-V2A-Retrieval.audio1K<n<10K0 likes47 downloads11d agoHugging Face06IAMCB /elise-clone Custom Elise-like TTS Dataset Converted on 2025-06-18T05:56:51Z. Samples: 1043 Format : 10-s clips with text transcription (like MrDragonFox/Elise) Structure column type description audio audio 24kHz mono wav clip text string transcription audio1K<n<10K0 likes40 downloads1y agoHugging Face07IAmSkyDra /LeViSQAaudio10K<n<100K0 likes29 downloads1y agoHugging Face08mmmsss1234 /iamnotthatkindoftalentaudion<1K0 likes24 downloads2mo agoHugging Face09IamPre /ts_datasetaudio1K<n<10K0 likes22 downloads1y agoHugging Face10IAmSkyDra /ViSQA-newaudion<1K0 likes20 downloads2y agoHugging Face11IAmSkyDra /ViSQA_plusaudion<1K0 likes19 downloads2y agoHugging Face12IAMCB /eightaudion<1K0 likes19 downloads1y agoHugging Face13IamV /fluent_slu_v1.0 Dataset Card for "fluent_slu_v1.0" More Information needed audio10K<n<100K0 likes18 downloads3y agoHugging Face14IAMCB /emotional_tts_datasetaudion<1K0 likes17 downloads1y agoHugging Face15IAMCB /Esp_datasetaudion<1K0 likes17 downloads1y agoHugging Face16iamjamuna /AffectHuman-43Kgated AffectHuman-43K AffectHuman-43K is an emotion-aligned multimodal benchmark for controlled human affect generation and evaluation. The benchmark contains 42,469 usable samples with complete image, reference-image, audio, and text coverage. Identity is specified through a visual reference image, while text, audio, and emotion labels provide affective control signals. This design separates identity preservation from affective control, enabling evaluation of whether a model can preserve… See the full description on the dataset page: https://huggingface.co/datasets/iamjamuna/AffectHuman-43K.audioimage-to-image10K<n<100K0 likes16 downloads4mo agoHugging Face17IAMCB /elise-modifiedaudio1K<n<10K0 likes15 downloads1y agoHugging Face18iamhuuphuc /vietnamese-music-datasetaudio1K<n<10K0 likes15 downloads1mo agoHugging Face19IAMTHEMUSIC /iammusicaudion<1K0 likes14 downloads2y agoHugging Face20IAMCB /Laila_low_pauseaudion<1K0 likes14 downloads1y agoHugging Face21IAMCB /vanessaaudio1K<n<10K0 likes14 downloads1y agoHugging Face22IAMCB /Laila_600ms_medium_pauseaudion<1K0 likes13 downloads1y agoHugging Face23IAMCB /24khz_800clipsaudion<1K0 likes13 downloads1y agoHugging Face24IAMCB /annaaudio1K<n<10K0 likes13 downloads1y agoHugging Face25IAMCB /11audion<1K0 likes12 downloads1y agoHugging Face26iamTangsang /nepali_to_english_pipeline_evaluation Nepali-English Speech-to-Text Translation Evaluation Dataset Dataset Description This dataset is designed for evaluating Nepali→English speech-to-text translation pipelines. It contains audio recordings of 300 Nepali sentences, spoken by three speakers, covering a range of sentence types (statements, questions, commands, complex sentences, and named entities/numbers). Each sentence is paired with: Source text (Nepali) transcription Reference English translation Audio… See the full description on the dataset page: https://huggingface.co/datasets/iamTangsang/nepali_to_english_pipeline_evaluation.audiotranslationn<1K0 likes12 downloads1y agoHugging Face27IAMCB /Laila_audio_formatedaudion<1K0 likes10 downloads1y agoHugging Face28IAMCB /laila_80_testaudion<1K0 likes10 downloads1y agoHugging Face29IAMCB /annadatav2.1audion<1K0 likes9 downloads1y agoHugging Face30Gorodinho /IA_MORAESaudion<1K0 likes8 downloads3y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.