datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
turkce_karisikTurkce-Atlas-Instruct
Türkçe Atlas — Büyük Ölçekli Türkçe Instruct SFT Veri Kümesi
Türkçe Atlas, Türkçe komut takibi ve sohbet modeli eğitimi için hazırlanmış, konuşma biçiminde 336.146 örnek içeren bir denetimli ince ayar (Supervised Fine-Tuning, SFT) veri kümesidir. Her kayıt tek bir messages alanından oluşur ve sabit olarak system → user → assistant sırasındaki üç mesajı içerir.
60 kayıtlık düzenli örneklemde yeniden yazma, özetleme, soru-cevap, yapılandırılmış çıktı üretme, Türkçe dilbilgisi… See the full description on the dataset page: https://huggingface.co/datasets/AlicanKiraz0/Turkce-Atlas-Instruct.turkce-sft-qa-3.7m
🇹🇷 Turkish SFT/QA — Birleştirilmiş ve Tekrarsız Veri Seti
3,723,264 örnek. 24 açık Türkçe SFT/QA veri setinin, satır düzeyinde
tekrar temizliği ve kalite kontrolünden geçirilmiş birleşimi. Her satır hangi veri
setinden geldiğini taşır.
English: A merged, row-level deduplicated and quality-filtered collection of
24 open Turkish SFT/QA datasets (3,723,264 examples). Every row carries
its source dataset, source URL and original license.
🙏 Teşekkür /… See the full description on the dataset page: https://huggingface.co/datasets/MercanAI/turkce-sft-qa-3.7m.yapay_zeka_turkce_mmlu_liderlik_tablosu
Yapay Zeka Türkçe MMLU Liderlik Tablosu
Bu veri seti serisi, Türkiye’deki eğitim sisteminde kullanılan gerçek sorularla yapay zeka modellerinin Türkçedeki yeteneklerini değerlendirmeyi amaçlar. Çeşitli büyük dil modellerinin (LLM) Türkçe Massive Multitask Language Understanding (MMLU) benchmark'ı üzerindeki performansını değerlendirir ve sıralar. Bu veri seti, modellerin Türkçe anlama ve cevaplama yeteneklerini karşılaştırmak için kapsamlı bir bakış açısı sunar. Her modelin… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_liderlik_tablosu.yapay_zeka_turkce_mmlu_bolum_sonuclari
Yapay Zeka Türkçe MMLU Bölüm Sonuçları
Bu veri seti, Türkiye'deki eğitim sisteminde kullanılan 62 farklı kategoriden sorularla yapay zeka modellerinin bölüm bazında performansını ölçmektedir. Her bölüm, Türkiye'deki eğitim sisteminde kullanılan gerçek sorulardan 100 tanesini içerir ve toplamda 6200 soru bulunmaktadır. Her bölümdeki doğru cevap oranları detaylandırılarak modellerin hangi konularda daha başarılı olduğunu belirlemek amacıyla oluşturulmuştur.
Veri Setinin… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_bolum_sonuclari.turkce-kitap
🔥 TurkishLLaVA OCR Enhancement Dataset
This dataset is a specialized books collection designed to improve the Turkish OCR (Optical Character Recognition) abilities of the Turkish-LLaVA-v0.1 model. It was created by collecting 100,000 books entirely from Turkish sources. The primary goal of this dataset is to enhance the model's ability to detect and interpret any text present in images.
Dataset Usage in Finetuning
This dataset played a crucial role in the… See the full description on the dataset page: https://huggingface.co/datasets/ytu-ce-cosmos/turkce-kitap.yapay_zeka_turkce_mmlu_model_cevaplari
Yapay Zeka Türkçe MMLU Model Cevapları
Bu veri seti, Türkiye'deki eğitim sistemine uygun gerçek sorularla yapay zeka modellerinin Türkçedeki yeteneklerini ölçmek için kullanılmıştır. Veri seti, yapay zeka modellerinin 62 kategorideki 6200 soruya verdiği cevapları içerir. Sorular ve verilen cevaplar, eğitim, sosyal bilimler, mühendislik ve çeşitli genel kültür konularını kapsamaktadır. Bu, modellerin Türkçe anlama, farklı konu alanlarındaki performansını ve cevap çeşitliliğini… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_model_cevaplari.turkce_kod_aciklama_dataset
Türkçe Mizahi Kod Açıklama Veri Seti
~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen
iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik
doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor.
Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar.
Özellikler
Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.turkce-saglik-qa
Türkçe Sağlık Soru-Cevap Veri Seti
Bu veri seti, dil modellerinin Türkçe genel sağlık sorularını yanıtlaması ve
gerektiğinde kullanıcıyı bir sağlık profesyoneline yönlendirmesi için ince
ayar (finetuning) amacıyla hazırlanmıştır.
Veri Yapısı
Veri seti DatasetDict ile düzenlenmiş tek bir bölüm içerir:
turkish: Diyabet, beslenme, obezite, fiziksel aktivite, anne ve bebek
sağlığı, çocuk ve ergen sağlığı, kronik hastalıklar, enfeksiyon
hastalıkları ve ruh sağlığı… See the full description on the dataset page: https://huggingface.co/datasets/seali/turkce-saglik-qa.Turkce-Kuran-Meali
📖 Türkçe Kur'an-ı Kerim Meali Veri Seti (Turkish Quran Dataset)
Bu veri seti, Kur'an-ı Kerim'in 114 Suresini ve toplam 6.236 Ayetini kapsayan, Doğal Dil İşleme (NLP), Yapay Zeka (LLM fine-tuning), Metin Çevirisi ve Dini Araştırmalar için özel olarak hazırlanmış kapsamlı, temizlenmiş ve yapılandırılmış bir veri setidir.
Veri setinde her bir ayet; orijinal Harekeli Arapça (Uthmani) metni, Türkçe Okunuşu/İsmi ve Diyanet İşleri Başkanlığı Türkçe Meali ile eşleştirilerek… See the full description on the dataset page: https://huggingface.co/datasets/itskerem4/Turkce-Kuran-Meali.turkce-robotik-sss
Türkçe Robotik SSS ve Terim Sözlüğü
Türkçe konuşan geliştiriciler, öğrenciler ve yapay zeka modelleri için hazırlanmış iki parçalı robotik veri kümesi:
Alt küme
Satır
İçerik
sss
1100
Gerçek kullanıcı sorularına dayalı Türkçe robotik soru-cevap çiftleri (kaynak URL'li)
terimler
79
İngilizce↔Türkçe robotik terminoloji sözlüğü, kısa tanımlarla
Alanlar
sss: soru (str), cevap (str), kaynak (str — cevabın yayınlandığı sayfa)
terimler: en (str), tr… See the full description on the dataset page: https://huggingface.co/datasets/unitreeturkiye/turkce-robotik-sss.tmp-turkce-doi-artifact-20260906turkce-tibbi-vektor-veri-seti
Turkce Tibbi Makale Vektor Veri Seti
umutertugrul/turkish-hospital-medical-articles veri
setinden secilen guven, medipol, florence hastane kaynaklarindan
402 makale parcalanip
magibu/embeddingmagibu-200m ile
vektorlestirildi. Toplam 3138 chunk.
Sutunlar
sutun
tip
aciklama
chunk_id
string
Parcanin kimligi (hastane-makale-bolum-parca)
url
string
Parcanin ait oldugu orijinal makalenin kaynak baglantisi
chunk_text
string
Parcalanmis metin icerigi (ham;… See the full description on the dataset page: https://huggingface.co/datasets/yoitsmeyusuf/turkce-tibbi-vektor-veri-seti.turkce-tibbi-rag-vektor-db
Türkçe Tıbbi Makaleler — Vektör Arama Veri Tabanı
Türkçe hastane sağlık rehberi makalelerinden oluşturulmuş, benzerlik eşiğiyle
filtrelenen bir vektör arama sistemi. Cevabı dokümanlarda bulunmayan sorularda sistem
içerik döndürmez.
Kaynak veri: umutertugrul/turkish-hospital-medical-articles
(erişim onayı gerektirir), atlas bölümü — 130 makale.
Veri tablosu
chunks.parquet dosyası şu kolonları içerir:
Kolon
Tip
Açıklama
url
string
Parçanın alındığı… See the full description on the dataset page: https://huggingface.co/datasets/nyzmemre/turkce-tibbi-rag-vektor-db.Turkce-Duygu-Analizi-DatasetTurkce-hendrycks_competition_math
This dataset is a machine-translated version of lighteval/MATH-Hard. We translated it using machine translation for the Teknofest 2024 Natural Language Processing competition.
turkce-sohbet-v2-17kturkce-atasozleri-lm-evaluation-harness
Data Source & Processing
This dataset is derived from furkanunluturk/turkce-atasozleri. To create a multiple-choice format, we used meta-llama/Llama-3.3-70B-Instruct embeddings to find the top 3 most similar results for each proverb definition, ensuring a similarity threshold of less than 0.92 to prevent duplicate answers. The 0.92 similarity threshold was chosen empirically and may be adjusted in the future.
Turkce-istatistik-benchmark
Türkçe İstatistik Benchmark
Bu veri seti, Toivo0/Turkce-istatistik-reasoning ana veri setiyle fine-tuning'de kesinlikle kullanılmamış 100 soru-cevap çiftinden oluşur. Fine-tune edilmiş modellerin gerçek performansını, eğitimde hiç görmediği sorularla ölçmek için hazırlanmıştır.
Benchmark iki aşamada oluşturulmuştur:
37 soru, ana veri setinden (400 soru) eğitim öncesinde stratified (modül bazında orantılı) olarak ayrılmış bölümdür.
63 soru, benchmark'ı istatistiksel olarak daha… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-benchmark.turkce-atasozleri
Atasözleri ve Anlamları Veri Seti
Bu veri seti, Türkçe atasözlerini ve onların açıklamalarını içermektedir. Söz Varlığımız: Atasözleri kaynağından elde edilmiştir.
Veri Seti Hakkında
Bu veri seti, Türk dilinde kullanılan atasözlerini ve bu atasözlerinin anlamlarını bir araya getirmektedir. Atasözleri, kültürel mirasımızın önemli bir parçasıdır ve bu veri seti, bu mirası koruma ve araştırma çalışmalarına katkıda bulunmayı amaçlamaktadır.
Veri Seti Özellikleri… See the full description on the dataset page: https://huggingface.co/datasets/furkanunluturk/turkce-atasozleri.Turkce-Haberbiyoloji-terimleri-turkce-sa
Biyoloji Terimleri - Türkçe Soru-Cevap Veri Seti
Bu veri seti, bir dil modelinin Türkçe biyoloji alanında ince ayar (fine-tune) edilmesi amacıyla hazırlanmıştır. Kaynağını MEB biyoloji ders kitaplarındaki terim ve tanımlar oluşturur.
Her kayıt bir soru ve buna karşılık gelen tanımdan meydana gelir. Terim-tanım çiftleri soru-cevap biçimine dönüştürülmüş, soruların tek tipleşmemesi için farklı soru kalıpları ("... nedir", "... ne demek", "... açıklar mısın" vb.) kullanılmıştır.… See the full description on the dataset page: https://huggingface.co/datasets/nyzmemre/biyoloji-terimleri-turkce-sa.turkce-bet-asistanTurkce-istatistik-reasoning
Türkçe İstatistik Muhakeme (Chain-of-Thought) Veri Seti
Türkçe'de istatistik konularında düşünce zinciri (chain-of-thought) içeren, soru-cevap formatında bir fine-tuning veri seti. Her örnek, bir kullanıcı sorusu ve modelin hem iç muhakeme sürecini (thinking) hem de nihai cevabını içeren bir asistan yanıtından oluşan bir conversations listesidir.
Veri Seti Özeti
Toplam örnek sayısı
400
Dil
Türkçe
Kapsanan modül sayısı
7
Soru tipleri
Kavramsal… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-reasoning.turkce-bet-asistan-v2turkce-otomobil-bakim-soru-cevap
Türkçe Otomobil Bakımı Soru-Cevap Veriseti
Bu veriseti otomobil bakımı, arıza ve sorunları hakkında Türkçe soru-cevap çiftleri içerir.
Format: Parquet
Not: Verisette hatalar ve eksiklikler bulunabilir. Katkı ve düzeltmeler için pull request açabilirsiniz.
Turkce_Lighteval_MATH-Hard
This dataset is a machine-translated version of lighteval/MATH-Hard. We translated it using machine translation for the Teknofest 2024 Natural Language Processing competition.
WildChat-turkce-expanded-messagesturkce-sentetik-otomotiv-yedek-parca-akil-yurutme
Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti
Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir.
İçerik
Özellik
Değer
Toplam Satır
~990
Dil
Türkçe
Lisans
MIT
Format
JSONL
Veri Yapısı… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-sentetik-otomotiv-yedek-parca-akil-yurutme.turkce_masallarlicense: cc0-1.0
language:
tr
tags:
art
folklore
stories
size_categories:
1K<n<10K
sources:
https://www.masaloku.net/
https://www.kisamasaloku.com/
https://www.masalsitesi.com/
https://www.uykumasallari.com/
dataset_description:
short: "Çocukluğun sıcaklığını taşıyan Türkçe masallar. Yaratıcı dil çalışmaları ve model eğitimi için uygun."
long: |
Kısa ve orta uzunlukta Türkçe masallar içerir. Anadolu anlatı geleneğini yansıtır.
Kamu malı veya paylaşılmaya uygun kaynaklardan derlenmiştir.… See the full description on the dataset page: https://huggingface.co/datasets/ceyyyh/turkce_masallar.
