datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
tajik-asr-corpus-v0
Tajik ASR Corpus v0
Deduplicated Tajik automatic speech recognition corpus assembled from FLEURS-derived
speech data, Mozilla Common Voice 25 Tajik, and Muhtasham Tajik ASR augmented data.
Format
Each split has a data.tsv and an audio/ directory.
TSV columns:
id
audio_filename
raw_transcription
transcription
characters
audio_bytes
source
source_id
duplicate_count
tajik_asr_combined.sqlite mirrors the TSV rows and includes normalized_text,
source_split, and… See the full description on the dataset page: https://huggingface.co/datasets/Peacockery/tajik-asr-corpus-v0.tajik-asr-augmented-testtajik-speech-datasettajik-asrtajik-voicechat-samples
Saidzoda Lab — Gated Research Dataset
Part of Saidzoda Lab's Central-Asian language research (Tajik, Uzbek, Kazakh, Kyrgyz).
Dataset contents, provenance, and statistics are not publicly disclosed.
Access is granted manually on request.
tajik-voice-agent-demo
Saidzoda Lab — Gated Research Dataset
Part of Saidzoda Lab's Central-Asian language research (Tajik, Uzbek, Kazakh, Kyrgyz).
Dataset contents, provenance, and statistics are not publicly disclosed.
Access is granted manually on request.
tajik-classic-audiobooks
Tajik Classic Audiobooks
Chapter-level audiobooks of classic Tajik/Persian literature, narrated by a single fine-tuned
Chatterbox-multilingual Tajik TTS voice (synthetic). Text was cleaned to spoken form (numbers
spelled out, no digits/Latin) and segmented per chapter. Each book folder holds mp3/ch_NNN.mp3
plus the source chapters_index.json and QC report.
Books included: shakuri_khuroson, shakuri_panturkizm, sadi_guliston, sadi_buston, nizami_layli, nizami_makhzan_khusrav… See the full description on the dataset page: https://huggingface.co/datasets/Tohirju/tajik-classic-audiobooks.tajik-audiobooks-chapters
Saidzoda Lab — Gated Research Dataset
Part of Saidzoda Lab's Central-Asian language research (Tajik, Uzbek, Kazakh, Kyrgyz).
Dataset contents, provenance, and statistics are not publicly disclosed.
Access is granted manually on request.
tajik-asr
Saidzoda Lab — Gated Research Dataset
Part of Saidzoda Lab's Central-Asian language research (Tajik, Uzbek, Kazakh, Kyrgyz).
Dataset contents, provenance, and statistics are not publicly disclosed.
Access is granted manually on request.
tajik-audio
Saidzoda Lab — Gated Research Dataset
Part of Saidzoda Lab's Central-Asian language research (Tajik, Uzbek, Kazakh, Kyrgyz).
Dataset contents, provenance, and statistics are not publicly disclosed.
Access is granted manually on request.
tajik-audiobooks
Saidzoda Lab — Gated Research Dataset
Part of Saidzoda Lab's Central-Asian language research (Tajik, Uzbek, Kazakh, Kyrgyz).
Dataset contents, provenance, and statistics are not publicly disclosed.
Access is granted manually on request.
tajik-audio
