turkic
Datasets
All datasets matching “turkic”turk-ictihat-kararlari-fulltext
Türk İçtihat Kararları - Tam Metin (UYAP e-Bedesten)
Adalet Bakanlığı UYAP Mevzuat ve İçtihat Programı (bedesten.adalet.gov.tr)
üzerinden derlenen Yargıtay kararları veri seti. Kavram bazlı arama
sorguları ile toplanmıştır.
Boyut
Kayıt: 9,899,589 benzersiz karar
Terim dağılımı: {"bosanma": 100052, "karar": 9894542, "nafaka": 66241, "tazminat": 100052}
Yıl aralığı: 1993-2026
Tam metni gelen karar: 39,301 (artımlı olarak dolduruluyor)
Şema… See the full description on the dataset page: https://huggingface.co/datasets/muhammedturan/turk-ictihat-kararlari-fulltext.turkic_tts_dataset
Turkic TTS Dataset
A multilingual TTS corpus covering Turkic languages.
Languages
Subset
Source
Speakers
azerbaijani
BHOSAI/Azerbaijani_News_TTS
1 (female)
bashkir
AigizK/bashkort_tts_dataset
8 (7F + 1M, ElevenLabs cloned)
Schema
Column
Type
Description
audio
Audio
Speech sample
text
string
Transcription
source_link
string
Original dataset URL
speaker_idstring
Speaker identifier (and style if applicable)
gender
string… See the full description on the dataset page: https://huggingface.co/datasets/futureDoctor/turkic_tts_dataset.turkicocr-cyrillic
TurkicOCR Synthetic Cyrillic Dataset
A large-scale synthetic dataset for document AI research in underrepresented Turkic languages — Kazakh and Kyrgyz. Built to cover the full document understanding pipeline: text detection, recognition (OCR), layout analysis, and visual document understanding (VDU).
Pages span 29 authentic document archetypes across administrative, educational, and commercial domains, rendered with 7 procedural degradation profiles that simulate real-world… See the full description on the dataset page: https://huggingface.co/datasets/alenisaw/turkicocr-cyrillic.turkic_xwmtA Large-Scale Study of Machine Translation in Turkic LanguagesTurkic_trainTurkic_train_lang_script_id
