CoolFace
15 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01MercanAI /turkce-sft-qa-3.7m 🇹🇷 Turkish SFT/QA — Birleştirilmiş ve Tekrarsız Veri Seti 3,723,264 örnek. 24 açık Türkçe SFT/QA veri setinin, satır düzeyinde tekrar temizliği ve kalite kontrolünden geçirilmiş birleşimi. Her satır hangi veri setinden geldiğini taşır. English: A merged, row-level deduplicated and quality-filtered collection of 24 open Turkish SFT/QA datasets (3,723,264 examples). Every row carries its source dataset, source URL and original license. 🙏 Teşekkür /… See the full description on the dataset page: https://huggingface.co/datasets/MercanAI/turkce-sft-qa-3.7m.tabulartext-generation1M<n<10M0 likes347 downloads2mo agoHugging Face02AlicanKiraz0 /Turkce-Atlas-Instruct Türkçe Atlas — Büyük Ölçekli Türkçe Instruct SFT Veri Kümesi Türkçe Atlas, Türkçe komut takibi ve sohbet modeli eğitimi için hazırlanmış, konuşma biçiminde 336.146 örnek içeren bir denetimli ince ayar (Supervised Fine-Tuning, SFT) veri kümesidir. Her kayıt tek bir messages alanından oluşur ve sabit olarak system → user → assistant sırasındaki üç mesajı içerir. 60 kayıtlık düzenli örneklemde yeniden yazma, özetleme, soru-cevap, yapılandırılmış çıktı üretme, Türkçe dilbilgisi… See the full description on the dataset page: https://huggingface.co/datasets/AlicanKiraz0/Turkce-Atlas-Instruct.texttext-generation100K<n<1M55 likes340 downloads3mo agoHugging Face03hoheyto /turkce_kod_aciklama_dataset Türkçe Mizahi Kod Açıklama Veri Seti ~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor. Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar. Özellikler Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.texttext-generationn<1K0 likes64 downloads23d agoHugging Face04itskerem4 /Turkce-Kuran-Meali 📖 Türkçe Kur'an-ı Kerim Meali Veri Seti (Turkish Quran Dataset) Bu veri seti, Kur'an-ı Kerim'in 114 Suresini ve toplam 6.236 Ayetini kapsayan, Doğal Dil İşleme (NLP), Yapay Zeka (LLM fine-tuning), Metin Çevirisi ve Dini Araştırmalar için özel olarak hazırlanmış kapsamlı, temizlenmiş ve yapılandırılmış bir veri setidir. Veri setinde her bir ayet; orijinal Harekeli Arapça (Uthmani) metni, Türkçe Okunuşu/İsmi ve Diyanet İşleri Başkanlığı Türkçe Meali ile eşleştirilerek… See the full description on the dataset page: https://huggingface.co/datasets/itskerem4/Turkce-Kuran-Meali.tabulartranslation1K<n<10K0 likes51 downloads2mo agoHugging Face05seali /turkce-saglik-qa Türkçe Sağlık Soru-Cevap Veri Seti Bu veri seti, dil modellerinin Türkçe genel sağlık sorularını yanıtlaması ve gerektiğinde kullanıcıyı bir sağlık profesyoneline yönlendirmesi için ince ayar (finetuning) amacıyla hazırlanmıştır. Veri Yapısı Veri seti DatasetDict ile düzenlenmiş tek bir bölüm içerir: turkish: Diyabet, beslenme, obezite, fiziksel aktivite, anne ve bebek sağlığı, çocuk ve ergen sağlığı, kronik hastalıklar, enfeksiyon hastalıkları ve ruh sağlığı… See the full description on the dataset page: https://huggingface.co/datasets/seali/turkce-saglik-qa.texttext-generationn<1K0 likes50 downloads2mo agoHugging Face06Toivo0 /Turkce-istatistik-benchmark Türkçe İstatistik Benchmark Bu veri seti, Toivo0/Turkce-istatistik-reasoning ana veri setiyle fine-tuning'de kesinlikle kullanılmamış 100 soru-cevap çiftinden oluşur. Fine-tune edilmiş modellerin gerçek performansını, eğitimde hiç görmediği sorularla ölçmek için hazırlanmıştır. Benchmark iki aşamada oluşturulmuştur: 37 soru, ana veri setinden (400 soru) eğitim öncesinde stratified (modül bazında orantılı) olarak ayrılmış bölümdür. 63 soru, benchmark'ı istatistiksel olarak daha… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-benchmark.texttext-generationn<1K0 likes41 downloads2mo agoHugging Face07Toivo0 /Turkce-istatistik-reasoning Türkçe İstatistik Muhakeme (Chain-of-Thought) Veri Seti Türkçe'de istatistik konularında düşünce zinciri (chain-of-thought) içeren, soru-cevap formatında bir fine-tuning veri seti. Her örnek, bir kullanıcı sorusu ve modelin hem iç muhakeme sürecini (thinking) hem de nihai cevabını içeren bir asistan yanıtından oluşan bir conversations listesidir. Veri Seti Özeti Toplam örnek sayısı 400 Dil Türkçe Kapsanan modül sayısı 7 Soru tipleri Kavramsal… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-reasoning.texttext-generationn<1K0 likes25 downloads2mo agoHugging Face08aiprojecom /turkce-otomobil-bakim-soru-cevap Türkçe Otomobil Bakımı Soru-Cevap Veriseti Bu veriseti otomobil bakımı, arıza ve sorunları hakkında Türkçe soru-cevap çiftleri içerir. Format: Parquet Not: Verisette hatalar ve eksiklikler bulunabilir. Katkı ve düzeltmeler için pull request açabilirsiniz. question-answering2 likes23 downloads5mo agoHugging Face09aiprojecom /turkce-sentetik-otomotiv-yedek-parca-akil-yurutme Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir. İçerik Özellik Değer Toplam Satır ~990 Dil Türkçe Lisans MIT Format JSONL Veri Yapısı… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-sentetik-otomotiv-yedek-parca-akil-yurutme.question-answering1 likes22 downloads5mo agoHugging Face10aiprojecom /turkce-otomobil-yedek-parca-soru-cevap-akil-yurutme Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir. İçerik Özellik Değer Toplam Satır ~11.454 Dil Türkçe Lisans MIT Format JSONL Veri… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-otomobil-yedek-parca-soru-cevap-akil-yurutme.question-answering1 likes20 downloads5mo agoHugging Face11YusufSimsek /turkce-atasozleri-dataset Türkçe Atasözleri Soru-Cevap Veri Seti Bu veri seti, Türkçe atasözlerinin anlamlarını açıklayan soru-cevap konuşmalarından oluşmaktadır. Veri Seti Bilgileri Dil: Türkçe Toplam kayıt: 1.398 Farklı atasözü: 466 Her atasözü için üç farklı soru biçimi Veri biçimi: Sohbet tabanlı JSON Veri bölümü: train Veri Yapısı Her kayıtta messages alanı içerisinde bir kullanıcı ve bir asistan mesajı bulunmaktadır. { "messages": [ { "content": "\"Akıl… See the full description on the dataset page: https://huggingface.co/datasets/YusufSimsek/turkce-atasozleri-dataset.texttext-generation1K<n<10K0 likes18 downloads2mo agoHugging Face12Bahadir26 /turkce-master-dataset-1280-capped Turkce Master Dataset 1280 Capped Egitim maliyetini kontrol etmek icin Qwen/Qwen3.5-2B tokenizer'i ile 1280 token ustundeki ornekler veri setine alinmadi. Istatistikler Alan Deger Base kaynaktan eklenen 69729 Ek kaynaktan eklenen 40411 Filtrelenen (>1280 token) 6198 Son toplam 103942 Ortalama token 573.84 Min token 61 Max token 1280 P90 token 1051 P95 token 1142 Format Her satir bir JSON nesnesidir:… See the full description on the dataset page: https://huggingface.co/datasets/Bahadir26/turkce-master-dataset-1280-capped.text-generation100K<n<1M0 likes14 downloads6mo agoHugging Face13aiprojecom /turkce-otomotiv-yedek-parca-youtube-soru-cevap-akil-yurutme Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir. İçerik Özellik Değer Toplam Satır ~260 Dil Türkçe Lisans MIT Format JSONL Veri Yapısı… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-otomotiv-yedek-parca-youtube-soru-cevap-akil-yurutme.question-answering1 likes14 downloads5mo agoHugging Face14namruni /turkce-yer-isimleri Türkçe Yer İsimleri Türkiye'ye ait yer adlarından derlenmiş, temizlenmiş kelime listesi. Tokenizer eğitimi ve Türkçe morfoloji denemeleri için hazırlandı. Dosya Ne Boyut temiz_yer_isimler.txt Temizlenmiş liste — satır başına bir ad 4.793 satır / 50.604 karakter yerisimleri.txt Ham liste (temizlik öncesi) 154 KB temizle_isimler.py Ham listeden temiz listeyi üreten betik — Kullanım isimler = open("temiz_yer_isimler.txt").read().splitlines()… See the full description on the dataset page: https://huggingface.co/datasets/namruni/turkce-yer-isimleri.texttext-generation10K<n<100K0 likes9 downloads2mo agoHugging Face15TuAFBogey /turkce-teknik-sft-v1 Turkce Teknik SFT Dataset v1 Multi-agent debate (Claude + DeepSeek R1) ile uretilmis Turkce teknik egitim verisi. Istatistikler Toplam: 503 ornek Thinking (CoT): 389 ornek (%77) Tool-use: 92 ornek (%18) Ortalama kalite skoru: 8.9/10 Konu sayisi: 30+ Zorluk dagilimi: 1-5 arasi dengeli Konular Embedded C, Linux kernel, network security, TCP/IP, Bluetooth BLE, CAN bus, Qt/QML, RF sinyaller, SNMP, TLS/SSL, Yocto, matematik, fizik, siber guvenlik, agentic… See the full description on the dataset page: https://huggingface.co/datasets/TuAFBogey/turkce-teknik-sft-v1.text-generationn<1K0 likes5 downloads6mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.