CoolFace
20 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01gokulsrinivasagan /audio_pretrain_tokenized_w2v2_7timeseries10K<n<100K0 likes199 downloads2y agoHugging Face02gokulsrinivasagan /audio_pretrain_tokenized_w2v2_14timeseries10K<n<100K0 likes151 downloads2y agoHugging Face03Aditya02 /AudioTokenized_Orpheus_TTS_Hindi10K<n<100K0 likes26 downloads9mo agoHugging Face04gokulsrinivasagan /audio_pretrain_tokenized_w2v2_13timeseries100K<n<1M0 likes24 downloads2y agoHugging Face05gokulsrinivasagan /audio_pretrain_tokenized_w2v2_11timeseries100K<n<1M0 likes17 downloads2y agoHugging Face06instinct-org /audio_youtube_chunked_tokenizedgated audio_youtube_chunked_tokenized This is a gated Uzbek tokenized speech dataset from instinct-org. This repository contains tokenized or prepared speech data for text-to-speech training workflows. Language Primary language: uz (Uzbek) Intended Use text-to-speech training Internal dataset curation, quality checks, and model evaluation Research or commercial use only after access approval and license review Data Notes Contains tokenized speech… See the full description on the dataset page: https://huggingface.co/datasets/instinct-org/audio_youtube_chunked_tokenized.tabulartext-to-speech100K<n<1M0 likes14 downloads4mo agoHugging Face07gokulsrinivasagan /audio_pretrain_tokenized_w2v2_5timeseries10K<n<100K0 likes13 downloads2y agoHugging Face08gokulsrinivasagan /audio_pretrain_tokenized_w2v2_8timeseries10K<n<100K0 likes12 downloads2y agoHugging Face09gokulsrinivasagan /audio_pretrain_tokenized_w2v2_1timeseries10K<n<100K0 likes10 downloads2y agoHugging Face10gokulsrinivasagan /audio_pretrain_tokenized_w2v2_9timeseries10K<n<100K0 likes10 downloads2y agoHugging Face11gokulsrinivasagan /audio_pretrain_tokenized_w2v2_10timeseries100K<n<1M0 likes10 downloads2y agoHugging Face12gokulsrinivasagan /audio_pretrain_tokenized_w2v2_6timeseries10K<n<100K0 likes9 downloads2y agoHugging Face13instinct-org /audio_youtube_chunked_qwen3_tts_12hz_tokenizedgated audio_youtube_chunked Qwen3-TTS 12Hz tokenized This dataset contains Qwen3-TTS 12Hz tokenized JSONL shards for audio_youtube_chunked from the OmniVoice NFA-aligned all-dataset preparation run. It is separate from the existing non-Qwen audio_youtube_chunked_tokenized artifacts. This repo contains tokenized JSONL records with audio_codes and metadata; raw audio files are not included. Tokenizer: Qwen/Qwen3-TTS-Tokenizer-12Hz Rows: 559475 Shards: 18 Published: 2026-05-28T20:57:59Z… See the full description on the dataset page: https://huggingface.co/datasets/instinct-org/audio_youtube_chunked_qwen3_tts_12hz_tokenized.100K<n<1M0 likes7 downloads4mo agoHugging Face14gokulsrinivasagan /audio_pretrain_tokenized_w2v2_2timeseries10K<n<100K0 likes6 downloads2y agoHugging Face15scwf /qjc-audio-tokenizedn<1K0 likes6 downloads1y agoHugging Face16gokulsrinivasagan /audio_pretrain_tokenized_w2v2_12timeseries100K<n<1M0 likes5 downloads2y agoHugging Face17FirstPotatoCoder /Genshin-Audio-Tokenized-40Hztabular10K<n<100K0 likes5 downloads4mo agoHugging Face18gokulsrinivasagan /audio_pretrain_tokenized_w2v2_4timeseries10K<n<100K0 likes4 downloads2y agoHugging Face19zed-m97 /nano4m-audio-tokenizedtext1K<n<10K0 likes4 downloads4mo agoHugging Face20gokulsrinivasagan /audio_pretrain_tokenized_w2v2_3timeseries10K<n<100K0 likes2 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.