datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
turkce-sft-qa-3.7m
🇹🇷 Turkish SFT/QA — Birleştirilmiş ve Tekrarsız Veri Seti
3,723,264 örnek. 24 açık Türkçe SFT/QA veri setinin, satır düzeyinde
tekrar temizliği ve kalite kontrolünden geçirilmiş birleşimi. Her satır hangi veri
setinden geldiğini taşır.
English: A merged, row-level deduplicated and quality-filtered collection of
24 open Turkish SFT/QA datasets (3,723,264 examples). Every row carries
its source dataset, source URL and original license.
🙏 Teşekkür /… See the full description on the dataset page: https://huggingface.co/datasets/MercanAI/turkce-sft-qa-3.7m.Turkce-Atlas-Instruct
Türkçe Atlas — Büyük Ölçekli Türkçe Instruct SFT Veri Kümesi
Türkçe Atlas, Türkçe komut takibi ve sohbet modeli eğitimi için hazırlanmış, konuşma biçiminde 336.146 örnek içeren bir denetimli ince ayar (Supervised Fine-Tuning, SFT) veri kümesidir. Her kayıt tek bir messages alanından oluşur ve sabit olarak system → user → assistant sırasındaki üç mesajı içerir.
60 kayıtlık düzenli örneklemde yeniden yazma, özetleme, soru-cevap, yapılandırılmış çıktı üretme, Türkçe dilbilgisi… See the full description on the dataset page: https://huggingface.co/datasets/AlicanKiraz0/Turkce-Atlas-Instruct.turkce_kod_aciklama_dataset
Türkçe Mizahi Kod Açıklama Veri Seti
~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen
iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik
doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor.
Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar.
Özellikler
Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.Turkce-Kuran-Meali
📖 Türkçe Kur'an-ı Kerim Meali Veri Seti (Turkish Quran Dataset)
Bu veri seti, Kur'an-ı Kerim'in 114 Suresini ve toplam 6.236 Ayetini kapsayan, Doğal Dil İşleme (NLP), Yapay Zeka (LLM fine-tuning), Metin Çevirisi ve Dini Araştırmalar için özel olarak hazırlanmış kapsamlı, temizlenmiş ve yapılandırılmış bir veri setidir.
Veri setinde her bir ayet; orijinal Harekeli Arapça (Uthmani) metni, Türkçe Okunuşu/İsmi ve Diyanet İşleri Başkanlığı Türkçe Meali ile eşleştirilerek… See the full description on the dataset page: https://huggingface.co/datasets/itskerem4/Turkce-Kuran-Meali.turkce-saglik-qa
Türkçe Sağlık Soru-Cevap Veri Seti
Bu veri seti, dil modellerinin Türkçe genel sağlık sorularını yanıtlaması ve
gerektiğinde kullanıcıyı bir sağlık profesyoneline yönlendirmesi için ince
ayar (finetuning) amacıyla hazırlanmıştır.
Veri Yapısı
Veri seti DatasetDict ile düzenlenmiş tek bir bölüm içerir:
turkish: Diyabet, beslenme, obezite, fiziksel aktivite, anne ve bebek
sağlığı, çocuk ve ergen sağlığı, kronik hastalıklar, enfeksiyon
hastalıkları ve ruh sağlığı… See the full description on the dataset page: https://huggingface.co/datasets/seali/turkce-saglik-qa.Turkce-istatistik-benchmark
Türkçe İstatistik Benchmark
Bu veri seti, Toivo0/Turkce-istatistik-reasoning ana veri setiyle fine-tuning'de kesinlikle kullanılmamış 100 soru-cevap çiftinden oluşur. Fine-tune edilmiş modellerin gerçek performansını, eğitimde hiç görmediği sorularla ölçmek için hazırlanmıştır.
Benchmark iki aşamada oluşturulmuştur:
37 soru, ana veri setinden (400 soru) eğitim öncesinde stratified (modül bazında orantılı) olarak ayrılmış bölümdür.
63 soru, benchmark'ı istatistiksel olarak daha… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-benchmark.Turkce-istatistik-reasoning
Türkçe İstatistik Muhakeme (Chain-of-Thought) Veri Seti
Türkçe'de istatistik konularında düşünce zinciri (chain-of-thought) içeren, soru-cevap formatında bir fine-tuning veri seti. Her örnek, bir kullanıcı sorusu ve modelin hem iç muhakeme sürecini (thinking) hem de nihai cevabını içeren bir asistan yanıtından oluşan bir conversations listesidir.
Veri Seti Özeti
Toplam örnek sayısı
400
Dil
Türkçe
Kapsanan modül sayısı
7
Soru tipleri
Kavramsal… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-reasoning.turkce-otomobil-bakim-soru-cevap
Türkçe Otomobil Bakımı Soru-Cevap Veriseti
Bu veriseti otomobil bakımı, arıza ve sorunları hakkında Türkçe soru-cevap çiftleri içerir.
Format: Parquet
Not: Verisette hatalar ve eksiklikler bulunabilir. Katkı ve düzeltmeler için pull request açabilirsiniz.
turkce-sentetik-otomotiv-yedek-parca-akil-yurutme
Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti
Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir.
İçerik
Özellik
Değer
Toplam Satır
~990
Dil
Türkçe
Lisans
MIT
Format
JSONL
Veri Yapısı… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-sentetik-otomotiv-yedek-parca-akil-yurutme.turkce-otomobil-yedek-parca-soru-cevap-akil-yurutme
Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti
Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir.
İçerik
Özellik
Değer
Toplam Satır
~11.454
Dil
Türkçe
Lisans
MIT
Format
JSONL
Veri… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-otomobil-yedek-parca-soru-cevap-akil-yurutme.turkce-atasozleri-dataset
Türkçe Atasözleri Soru-Cevap Veri Seti
Bu veri seti, Türkçe atasözlerinin anlamlarını açıklayan soru-cevap konuşmalarından oluşmaktadır.
Veri Seti Bilgileri
Dil: Türkçe
Toplam kayıt: 1.398
Farklı atasözü: 466
Her atasözü için üç farklı soru biçimi
Veri biçimi: Sohbet tabanlı JSON
Veri bölümü: train
Veri Yapısı
Her kayıtta messages alanı içerisinde bir kullanıcı ve bir asistan mesajı bulunmaktadır.
{
"messages": [
{
"content": "\"Akıl… See the full description on the dataset page: https://huggingface.co/datasets/YusufSimsek/turkce-atasozleri-dataset.turkce-master-dataset-1280-capped
Turkce Master Dataset 1280 Capped
Egitim maliyetini kontrol etmek icin Qwen/Qwen3.5-2B tokenizer'i ile 1280 token ustundeki ornekler veri setine alinmadi.
Istatistikler
Alan
Deger
Base kaynaktan eklenen
69729
Ek kaynaktan eklenen
40411
Filtrelenen (>1280 token)
6198
Son toplam
103942
Ortalama token
573.84
Min token
61
Max token
1280
P90 token
1051
P95 token
1142
Format
Her satir bir JSON nesnesidir:… See the full description on the dataset page: https://huggingface.co/datasets/Bahadir26/turkce-master-dataset-1280-capped.turkce-otomotiv-yedek-parca-youtube-soru-cevap-akil-yurutme
Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti
Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir.
İçerik
Özellik
Değer
Toplam Satır
~260
Dil
Türkçe
Lisans
MIT
Format
JSONL
Veri Yapısı… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-otomotiv-yedek-parca-youtube-soru-cevap-akil-yurutme.turkce-yer-isimleri
Türkçe Yer İsimleri
Türkiye'ye ait yer adlarından derlenmiş, temizlenmiş kelime listesi.
Tokenizer eğitimi ve Türkçe morfoloji denemeleri için hazırlandı.
Dosya
Ne
Boyut
temiz_yer_isimler.txt
Temizlenmiş liste — satır başına bir ad
4.793 satır / 50.604 karakter
yerisimleri.txt
Ham liste (temizlik öncesi)
154 KB
temizle_isimler.py
Ham listeden temiz listeyi üreten betik
—
Kullanım
isimler = open("temiz_yer_isimler.txt").read().splitlines()… See the full description on the dataset page: https://huggingface.co/datasets/namruni/turkce-yer-isimleri.turkce-teknik-sft-v1
Turkce Teknik SFT Dataset v1
Multi-agent debate (Claude + DeepSeek R1) ile uretilmis Turkce teknik egitim verisi.
Istatistikler
Toplam: 503 ornek
Thinking (CoT): 389 ornek (%77)
Tool-use: 92 ornek (%18)
Ortalama kalite skoru: 8.9/10
Konu sayisi: 30+
Zorluk dagilimi: 1-5 arasi dengeli
Konular
Embedded C, Linux kernel, network security, TCP/IP, Bluetooth BLE, CAN bus,
Qt/QML, RF sinyaller, SNMP, TLS/SSL, Yocto, matematik, fizik, siber guvenlik,
agentic… See the full description on the dataset page: https://huggingface.co/datasets/TuAFBogey/turkce-teknik-sft-v1.
