datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Turkce-Atlas-Instruct
Türkçe Atlas — Büyük Ölçekli Türkçe Instruct SFT Veri Kümesi
Türkçe Atlas, Türkçe komut takibi ve sohbet modeli eğitimi için hazırlanmış, konuşma biçiminde 336.146 örnek içeren bir denetimli ince ayar (Supervised Fine-Tuning, SFT) veri kümesidir. Her kayıt tek bir messages alanından oluşur ve sabit olarak system → user → assistant sırasındaki üç mesajı içerir.
60 kayıtlık düzenli örneklemde yeniden yazma, özetleme, soru-cevap, yapılandırılmış çıktı üretme, Türkçe dilbilgisi… See the full description on the dataset page: https://huggingface.co/datasets/AlicanKiraz0/Turkce-Atlas-Instruct.turkce-kitap
🔥 TurkishLLaVA OCR Enhancement Dataset
This dataset is a specialized books collection designed to improve the Turkish OCR (Optical Character Recognition) abilities of the Turkish-LLaVA-v0.1 model. It was created by collecting 100,000 books entirely from Turkish sources. The primary goal of this dataset is to enhance the model's ability to detect and interpret any text present in images.
Dataset Usage in Finetuning
This dataset played a crucial role in the… See the full description on the dataset page: https://huggingface.co/datasets/ytu-ce-cosmos/turkce-kitap.turkce_kod_aciklama_dataset
Türkçe Mizahi Kod Açıklama Veri Seti
~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen
iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik
doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor.
Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar.
Özellikler
Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.turkce-robotik-sss
Türkçe Robotik SSS ve Terim Sözlüğü
Türkçe konuşan geliştiriciler, öğrenciler ve yapay zeka modelleri için hazırlanmış iki parçalı robotik veri kümesi:
Alt küme
Satır
İçerik
sss
1100
Gerçek kullanıcı sorularına dayalı Türkçe robotik soru-cevap çiftleri (kaynak URL'li)
terimler
79
İngilizce↔Türkçe robotik terminoloji sözlüğü, kısa tanımlarla
Alanlar
sss: soru (str), cevap (str), kaynak (str — cevabın yayınlandığı sayfa)
terimler: en (str), tr… See the full description on the dataset page: https://huggingface.co/datasets/unitreeturkiye/turkce-robotik-sss.turkce-tibbi-rag-vektor-db
Türkçe Tıbbi Makaleler — Vektör Arama Veri Tabanı
Türkçe hastane sağlık rehberi makalelerinden oluşturulmuş, benzerlik eşiğiyle
filtrelenen bir vektör arama sistemi. Cevabı dokümanlarda bulunmayan sorularda sistem
içerik döndürmez.
Kaynak veri: umutertugrul/turkish-hospital-medical-articles
(erişim onayı gerektirir), atlas bölümü — 130 makale.
Veri tablosu
chunks.parquet dosyası şu kolonları içerir:
Kolon
Tip
Açıklama
url
string
Parçanın alındığı… See the full description on the dataset page: https://huggingface.co/datasets/nyzmemre/turkce-tibbi-rag-vektor-db.turkce-sohbet-v2-17kTurkce-Haberturkce-bet-asistanTurkce-istatistik-reasoning
Türkçe İstatistik Muhakeme (Chain-of-Thought) Veri Seti
Türkçe'de istatistik konularında düşünce zinciri (chain-of-thought) içeren, soru-cevap formatında bir fine-tuning veri seti. Her örnek, bir kullanıcı sorusu ve modelin hem iç muhakeme sürecini (thinking) hem de nihai cevabını içeren bir asistan yanıtından oluşan bir conversations listesidir.
Veri Seti Özeti
Toplam örnek sayısı
400
Dil
Türkçe
Kapsanan modül sayısı
7
Soru tipleri
Kavramsal… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-reasoning.turkce-bet-asistan-v2turkce-secme-klasikler-1turk_ceza_kanunlari
🇹🇷 Türk Ceza Kanunu Soru-Cevap & RAG Veri Seti
Bu veri seti, Türk hukuk sistemindeki temel kanunları (başta TCK olmak üzere) kapsayan, model eğitimi ve bağlamsal bilgi çıkarma (RAG) süreçleri için optimize edilmiş 7.226 adet zenginleştirilmiş kayıt içermektedir.
📊 Veri Seti Özeti
Özellik
Detay
Toplam Soru
7.000+
Dosya Boyutu
~17.74 MB (JSON)
Kapsanan Mevzuat
TCK, CMK, TMK (3713), KVKK (6698), Trafik (2918), Bahis (7258), Kabahatler (5326) ve fazlası… See the full description on the dataset page: https://huggingface.co/datasets/emin037/turk_ceza_kanunlari.turkce-atasozleri-dataset
Türkçe Atasözleri Soru-Cevap Veri Seti
Bu veri seti, Türkçe atasözlerinin anlamlarını açıklayan soru-cevap konuşmalarından oluşmaktadır.
Veri Seti Bilgileri
Dil: Türkçe
Toplam kayıt: 1.398
Farklı atasözü: 466
Her atasözü için üç farklı soru biçimi
Veri biçimi: Sohbet tabanlı JSON
Veri bölümü: train
Veri Yapısı
Her kayıtta messages alanı içerisinde bir kullanıcı ve bir asistan mesajı bulunmaktadır.
{
"messages": [
{
"content": "\"Akıl… See the full description on the dataset page: https://huggingface.co/datasets/YusufSimsek/turkce-atasozleri-dataset.turk-ceza-kanunu-evaluation-dataset
Dataset Description
This dataset is created to evaluate large language models and GraphRAG systems operating on the Turkish Penal Code (TCK) texts. It is used to test the systems' performance in accurately retrieving legal context and generating correct answers while strictly adhering to the provided legal text.
Data Structure and Columns
soru: The legal question text to be provided as input to the system.
cevap: The verified legal response that the system is expected to… See the full description on the dataset page: https://huggingface.co/datasets/hzfokyn/turk-ceza-kanunu-evaluation-dataset.Hastalik-Aciklama-Turkce
Dataset
Bu veri seti Hastalik-Semptonları-Turkce veri setinin devamıdır. Burada hastalıklar hakkında bilgiler bulunmaktadır.
llama3.2_turkce_dataset4llama3_turkce_datasetllama3.2_turkce_dataset6llama3.2_turkce_dataset2llama3.2_turkce_dataset3llama3.2_turkce_dataset5turkce-mlx-alignment-dataset
