CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01lenamerkli /distilled-web Dataset Card for lenamerkli/distilled-web This dataset consists of web-scraped data using a custom crawler purpose-built for each website. Dataset Details Dataset Sources Repository: https://github.com/lenamerkli/distilled-web Uses This dataset is useful for training large language models. The train split provides instruction-following and chat data for supervised fine-tuning (SFT) and instruction tuning. The pretrain split… See the full description on the dataset page: https://huggingface.co/datasets/lenamerkli/distilled-web.audiotext-generation1M<n<10M3 likes1.1k downloads7d agoHugging Face02WillHeld /HeySQuAD_distillaudio100K<n<1M1 likes342 downloads2y agoHugging Face03btemirov /distill-whisper-fin-jargonaudion<1K0 likes225 downloads3y agoHugging Face04niloy629 /personaplex-distill-conversations PersonaPlex Distillation Conversation Dataset Teacher-generated multi-turn conversation data for distilling/pruning NVIDIA PersonaPlex 7B (a Moshi-architecture full-duplex speech-to-speech model). What this is Each sample is a real conversation rendered by the PersonaPlex teacher itself: The student's turns are scripted (generated by Qwen3-8B) and voiced with Piper TTS The teacher's (PersonaPlex's) responses are improvised live by the model — its real… See the full description on the dataset page: https://huggingface.co/datasets/niloy629/personaplex-distill-conversations.audioaudio-to-audion<1K0 likes179 downloads12d agoHugging Face05Alright7398 /modded-distill-wavlm-base Dataset Summary Lance tables of LibriSpeech utterances at 16 kHz with cached last-layer representations from frozen microsoft/wavlm-base. This release is a precomputed teacher cache plus raw audio bytes, not a general-purpose speech benchmark split. Structure Local / mirrored Hub layout: Directory Content train/ LibriSpeech 960 h train corpora: train-clean-100, train-clean-360, train-other-500. eval/ LibriSpeech dev-clean. Each of train/ and eval/ is a… See the full description on the dataset page: https://huggingface.co/datasets/Alright7398/modded-distill-wavlm-base.audiofeature-extraction1M<n<10M0 likes129 downloads5mo agoHugging Face06BarryFutureman /vox2_3D_distill_shard22audio1K<n<10K0 likes105 downloads1y agoHugging Face07BarryFutureman /vox2_3D_distill_shard24audio10K<n<100K0 likes87 downloads1y agoHugging Face08BarryFutureman /vox2_3D_distill_shard21audio10K<n<100K0 likes86 downloads1y agoHugging Face09BarryFutureman /vox2_3D_distill_shard23audio10K<n<100K0 likes80 downloads1y agoHugging Face10BarryFutureman /vox2_3D_distill_shard13audio10K<n<100K0 likes79 downloads1y agoHugging Face11BarryFutureman /vox2_3D_distill_shard17audio10K<n<100K0 likes79 downloads1y agoHugging Face12BarryFutureman /vox2_3D_distill_shard16audio10K<n<100K0 likes76 downloads1y agoHugging Face13BarryFutureman /vox2_3D_distill_shard40audio10K<n<100K0 likes75 downloads1y agoHugging Face14BarryFutureman /vox2_3D_distill_shard42audio1K<n<10K0 likes75 downloads1y agoHugging Face15BarryFutureman /vox2_3D_distill_shard14audio10K<n<100K0 likes73 downloads1y agoHugging Face16BarryFutureman /vox2_3D_distill_shard32audio1K<n<10K0 likes73 downloads1y agoHugging Face17Darejkal /distill-4audion<1K0 likes68 downloads1y agoHugging Face18BarryFutureman /vox2_3D_distill_shard20audio1K<n<10K0 likes63 downloads1y agoHugging Face19BarryFutureman /maya-distill-dataaudio10K<n<100K1 likes56 downloads11mo agoHugging Face20guangzhaoli /multilingual-test-distill-strong-tts-20260520 Multilingual Test Distill Strong TTS 20260520 This repository contains a distributable tar-sharded version of multilingual_test_distill_strong_tts_20260520. The dataset follows the local voice_dataset/data layout after extraction: data/csvs/metadata_zh.csv data/csvs/metadata_en.csv data/csvs/metadata_ja.csv data/csvs/metadata_ko.csv data/zh/**/*.wav data/en/**/*.wav data/ja/**/*.wav data/ko/**/*.wav Metadata format: file_path|duration|dnsmos|text dnsmos is intentionally blank… See the full description on the dataset page: https://huggingface.co/datasets/guangzhaoli/multilingual-test-distill-strong-tts-20260520.audiotext-to-speech1K<n<10K0 likes39 downloads4mo agoHugging Face21mask-distilled-libri-one-sec-cv12 /chunk_20audio10K<n<100K0 likes36 downloads2y agoHugging Face22mask-distilled-libri-one-sec-cv12 /chunk_204audio10K<n<100K0 likes35 downloads2y agoHugging Face23mask-distilled-libri-one-sec-cv12 /chunk_237audio10K<n<100K0 likes30 downloads2y agoHugging Face24mask-distilled-libri-one-sec-cv12 /chunk_208audio10K<n<100K0 likes29 downloads2y agoHugging Face25milanakdj /nepali-oov-distilledgated Nepali OOV-distilled subset (854 h) An OOV-dense distillation of Premal-12/c9nepali-audio-dataset2 (used with the author's permission), shipped in four variants: the original single-voice audio, a CPU-augmented copy, and 244 h re-rendered onto 1,842 real human speakers with Seed-VC. For Nepali ASR and TTS work. Filter with the variant field -- see Composition below. If you came here for speaker diversity, you want variant == "vc". What this is The source corpus is… See the full description on the dataset page: https://huggingface.co/datasets/milanakdj/nepali-oov-distilled.audioautomatic-speech-recognition10K<n<100K1 likes29 downloads10d agoHugging Face26mask-distilled-libri-one-sec-cv12 /chunk_19audio10K<n<100K0 likes27 downloads2y agoHugging Face27mask-distilled-libri-one-sec-cv12 /chunk_38audio10K<n<100K0 likes27 downloads2y agoHugging Face28mask-distilled-libri-one-sec-cv12 /chunk_142audio10K<n<100K0 likes26 downloads2y agoHugging Face29mask-distilled-libri-one-sec-cv12 /chunk_209audio10K<n<100K0 likes24 downloads2y agoHugging Face30BarryFutureman /vox2_3D_distill_shard_06audio1K<n<10K0 likes24 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.