audio_tokenized
audio_pretrain_tokenized_w2v2_7audio_pretrain_tokenized_w2v2_14audio_pretrain_tokenized_w2v2_13AudioTokenized_Orpheus_TTS_Hindiaudio_pretrain_tokenized_w2v2_11audio_youtube_chunked_tokenized
audio_youtube_chunked_tokenized
This is a gated Uzbek tokenized speech dataset from instinct-org.
This repository contains tokenized or prepared speech data for text-to-speech training workflows.
Language
Primary language: uz (Uzbek)
Intended Use
text-to-speech training
Internal dataset curation, quality checks, and model evaluation
Research or commercial use only after access approval and license review
Data Notes
Contains tokenized speech… See the full description on the dataset page: https://huggingface.co/datasets/instinct-org/audio_youtube_chunked_tokenized.
