CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01seljux /turkce_karisiktext10K<n<100K1 likes810 downloads2y agoHugging Face02AlicanKiraz0 /Turkce-Atlas-Instruct Türkçe Atlas — Büyük Ölçekli Türkçe Instruct SFT Veri Kümesi Türkçe Atlas, Türkçe komut takibi ve sohbet modeli eğitimi için hazırlanmış, konuşma biçiminde 336.146 örnek içeren bir denetimli ince ayar (Supervised Fine-Tuning, SFT) veri kümesidir. Her kayıt tek bir messages alanından oluşur ve sabit olarak system → user → assistant sırasındaki üç mesajı içerir. 60 kayıtlık düzenli örneklemde yeniden yazma, özetleme, soru-cevap, yapılandırılmış çıktı üretme, Türkçe dilbilgisi… See the full description on the dataset page: https://huggingface.co/datasets/AlicanKiraz0/Turkce-Atlas-Instruct.texttext-generation100K<n<1M55 likes355 downloads3mo agoHugging Face03MercanAI /turkce-sft-qa-3.7m 🇹🇷 Turkish SFT/QA — Birleştirilmiş ve Tekrarsız Veri Seti 3,723,264 örnek. 24 açık Türkçe SFT/QA veri setinin, satır düzeyinde tekrar temizliği ve kalite kontrolünden geçirilmiş birleşimi. Her satır hangi veri setinden geldiğini taşır. English: A merged, row-level deduplicated and quality-filtered collection of 24 open Turkish SFT/QA datasets (3,723,264 examples). Every row carries its source dataset, source URL and original license. 🙏 Teşekkür /… See the full description on the dataset page: https://huggingface.co/datasets/MercanAI/turkce-sft-qa-3.7m.tabulartext-generation1M<n<10M0 likes341 downloads2mo agoHugging Face04alibayram /yapay_zeka_turkce_mmlu_liderlik_tablosu Yapay Zeka Türkçe MMLU Liderlik Tablosu Bu veri seti serisi, Türkiye’deki eğitim sisteminde kullanılan gerçek sorularla yapay zeka modellerinin Türkçedeki yeteneklerini değerlendirmeyi amaçlar. Çeşitli büyük dil modellerinin (LLM) Türkçe Massive Multitask Language Understanding (MMLU) benchmark'ı üzerindeki performansını değerlendirir ve sıralar. Bu veri seti, modellerin Türkçe anlama ve cevaplama yeteneklerini karşılaştırmak için kapsamlı bir bakış açısı sunar. Her modelin… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_liderlik_tablosu.tabularn<1K8 likes284 downloads1y agoHugging Face05alibayram /yapay_zeka_turkce_mmlu_bolum_sonuclari Yapay Zeka Türkçe MMLU Bölüm Sonuçları Bu veri seti, Türkiye'deki eğitim sisteminde kullanılan 62 farklı kategoriden sorularla yapay zeka modellerinin bölüm bazında performansını ölçmektedir. Her bölüm, Türkiye'deki eğitim sisteminde kullanılan gerçek sorulardan 100 tanesini içerir ve toplamda 6200 soru bulunmaktadır. Her bölümdeki doğru cevap oranları detaylandırılarak modellerin hangi konularda daha başarılı olduğunu belirlemek amacıyla oluşturulmuştur. Veri Setinin… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_bolum_sonuclari.tabularn<1K15 likes179 downloads1y agoHugging Face06ytu-ce-cosmos /turkce-kitap 🔥 TurkishLLaVA OCR Enhancement Dataset This dataset is a specialized books collection designed to improve the Turkish OCR (Optical Character Recognition) abilities of the Turkish-LLaVA-v0.1 model. It was created by collecting 100,000 books entirely from Turkish sources. The primary goal of this dataset is to enhance the model's ability to detect and interpret any text present in images. Dataset Usage in Finetuning This dataset played a crucial role in the… See the full description on the dataset page: https://huggingface.co/datasets/ytu-ce-cosmos/turkce-kitap.text100K<n<1M13 likes145 downloads2y agoHugging Face07alibayram /yapay_zeka_turkce_mmlu_model_cevaplari Yapay Zeka Türkçe MMLU Model Cevapları Bu veri seti, Türkiye'deki eğitim sistemine uygun gerçek sorularla yapay zeka modellerinin Türkçedeki yeteneklerini ölçmek için kullanılmıştır. Veri seti, yapay zeka modellerinin 62 kategorideki 6200 soruya verdiği cevapları içerir. Sorular ve verilen cevaplar, eğitim, sosyal bilimler, mühendislik ve çeşitli genel kültür konularını kapsamaktadır. Bu, modellerin Türkçe anlama, farklı konu alanlarındaki performansını ve cevap çeşitliliğini… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_model_cevaplari.text1K<n<10K9 likes90 downloads1y agoHugging Face08hoheyto /turkce_kod_aciklama_dataset Türkçe Mizahi Kod Açıklama Veri Seti ~900 örnek, her biri bir Python fonksiyonu (code) ve buna karşılık gelen iki cümlelik Türkçe açıklamadan (explanation) oluşuyor — ilk cümle teknik doğruluk, ikinci cümle kodun mantığına bağlı hafif bir mizah içeriyor. Kod kaynağı: LeetCode-tarzı problemler + ast ile programatik üretilmiş, zorluk seviyesine göre dağıtılmış özgün algoritmalar. Özellikler Kelime tekrarı eğilimi: Model, bazı sıfatları ("titiz" gibi) fazla tekrar… See the full description on the dataset page: https://huggingface.co/datasets/hoheyto/turkce_kod_aciklama_dataset.texttext-generationn<1K0 likes64 downloads23d agoHugging Face09seali /turkce-saglik-qa Türkçe Sağlık Soru-Cevap Veri Seti Bu veri seti, dil modellerinin Türkçe genel sağlık sorularını yanıtlaması ve gerektiğinde kullanıcıyı bir sağlık profesyoneline yönlendirmesi için ince ayar (finetuning) amacıyla hazırlanmıştır. Veri Yapısı Veri seti DatasetDict ile düzenlenmiş tek bir bölüm içerir: turkish: Diyabet, beslenme, obezite, fiziksel aktivite, anne ve bebek sağlığı, çocuk ve ergen sağlığı, kronik hastalıklar, enfeksiyon hastalıkları ve ruh sağlığı… See the full description on the dataset page: https://huggingface.co/datasets/seali/turkce-saglik-qa.texttext-generationn<1K0 likes51 downloads2mo agoHugging Face10itskerem4 /Turkce-Kuran-Meali 📖 Türkçe Kur'an-ı Kerim Meali Veri Seti (Turkish Quran Dataset) Bu veri seti, Kur'an-ı Kerim'in 114 Suresini ve toplam 6.236 Ayetini kapsayan, Doğal Dil İşleme (NLP), Yapay Zeka (LLM fine-tuning), Metin Çevirisi ve Dini Araştırmalar için özel olarak hazırlanmış kapsamlı, temizlenmiş ve yapılandırılmış bir veri setidir. Veri setinde her bir ayet; orijinal Harekeli Arapça (Uthmani) metni, Türkçe Okunuşu/İsmi ve Diyanet İşleri Başkanlığı Türkçe Meali ile eşleştirilerek… See the full description on the dataset page: https://huggingface.co/datasets/itskerem4/Turkce-Kuran-Meali.tabulartranslation1K<n<10K0 likes51 downloads2mo agoHugging Face11unitreeturkiye /turkce-robotik-sss Türkçe Robotik SSS ve Terim Sözlüğü Türkçe konuşan geliştiriciler, öğrenciler ve yapay zeka modelleri için hazırlanmış iki parçalı robotik veri kümesi: Alt küme Satır İçerik sss 1100 Gerçek kullanıcı sorularına dayalı Türkçe robotik soru-cevap çiftleri (kaynak URL'li) terimler 79 İngilizce↔Türkçe robotik terminoloji sözlüğü, kısa tanımlarla Alanlar sss: soru (str), cevap (str), kaynak (str — cevabın yayınlandığı sayfa) terimler: en (str), tr… See the full description on the dataset page: https://huggingface.co/datasets/unitreeturkiye/turkce-robotik-sss.textquestion-answering1K<n<10K0 likes48 downloads2mo agoHugging Face12nmsofficial /tmp-turkce-doi-artifact-20260906text100K<n<1M0 likes43 downloads19d agoHugging Face13yoitsmeyusuf /turkce-tibbi-vektor-veri-seti Turkce Tibbi Makale Vektor Veri Seti umutertugrul/turkish-hospital-medical-articles veri setinden secilen guven, medipol, florence hastane kaynaklarindan 402 makale parcalanip magibu/embeddingmagibu-200m ile vektorlestirildi. Toplam 3138 chunk. Sutunlar sutun tip aciklama chunk_id string Parcanin kimligi (hastane-makale-bolum-parca) url string Parcanin ait oldugu orijinal makalenin kaynak baglantisi chunk_text string Parcalanmis metin icerigi (ham;… See the full description on the dataset page: https://huggingface.co/datasets/yoitsmeyusuf/turkce-tibbi-vektor-veri-seti.textfeature-extraction1K<n<10K0 likes39 downloads2mo agoHugging Face14nyzmemre /turkce-tibbi-rag-vektor-db Türkçe Tıbbi Makaleler — Vektör Arama Veri Tabanı Türkçe hastane sağlık rehberi makalelerinden oluşturulmuş, benzerlik eşiğiyle filtrelenen bir vektör arama sistemi. Cevabı dokümanlarda bulunmayan sorularda sistem içerik döndürmez. Kaynak veri: umutertugrul/turkish-hospital-medical-articles (erişim onayı gerektirir), atlas bölümü — 130 makale. Veri tablosu chunks.parquet dosyası şu kolonları içerir: Kolon Tip Açıklama url string Parçanın alındığı… See the full description on the dataset page: https://huggingface.co/datasets/nyzmemre/turkce-tibbi-rag-vektor-db.textn<1K0 likes36 downloads2mo agoHugging Face15WhiteAngelss /Turkce-Duygu-Analizi-Datasettext100K<n<1M2 likes35 downloads2y agoHugging Face16Karayel-DDI /Turkce-hendrycks_competition_math This dataset is a machine-translated version of lighteval/MATH-Hard. We translated it using machine translation for the Teknofest 2024 Natural Language Processing competition. text10K<n<100K1 likes33 downloads2y agoHugging Face17Bahadir26 /turkce-sohbet-v2-17ktext10K<n<100K1 likes32 downloads6mo agoHugging Face18abrek /turkce-atasozleri-lm-evaluation-harness Data Source & Processing This dataset is derived from furkanunluturk/turkce-atasozleri. To create a multiple-choice format, we used meta-llama/Llama-3.3-70B-Instruct embeddings to find the top 3 most similar results for each proverb definition, ensuring a similarity threshold of less than 0.92 to prevent duplicate answers. The 0.92 similarity threshold was chosen empirically and may be adjusted in the future. textmultiple-choice1K<n<10K1 likes30 downloads1y agoHugging Face19Toivo0 /Turkce-istatistik-benchmark Türkçe İstatistik Benchmark Bu veri seti, Toivo0/Turkce-istatistik-reasoning ana veri setiyle fine-tuning'de kesinlikle kullanılmamış 100 soru-cevap çiftinden oluşur. Fine-tune edilmiş modellerin gerçek performansını, eğitimde hiç görmediği sorularla ölçmek için hazırlanmıştır. Benchmark iki aşamada oluşturulmuştur: 37 soru, ana veri setinden (400 soru) eğitim öncesinde stratified (modül bazında orantılı) olarak ayrılmış bölümdür. 63 soru, benchmark'ı istatistiksel olarak daha… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-benchmark.texttext-generationn<1K0 likes30 downloads2mo agoHugging Face20furkanunluturk /turkce-atasozleri Atasözleri ve Anlamları Veri Seti Bu veri seti, Türkçe atasözlerini ve onların açıklamalarını içermektedir. Söz Varlığımız: Atasözleri kaynağından elde edilmiştir. Veri Seti Hakkında Bu veri seti, Türk dilinde kullanılan atasözlerini ve bu atasözlerinin anlamlarını bir araya getirmektedir. Atasözleri, kültürel mirasımızın önemli bir parçasıdır ve bu veri seti, bu mirası koruma ve araştırma çalışmalarına katkıda bulunmayı amaçlamaktadır. Veri Seti Özellikleri… See the full description on the dataset page: https://huggingface.co/datasets/furkanunluturk/turkce-atasozleri.text1K<n<10K11 likes29 downloads2y agoHugging Face21root-0 /Turkce-Habertext10K<n<100K0 likes27 downloads1y agoHugging Face22nyzmemre /biyoloji-terimleri-turkce-sa Biyoloji Terimleri - Türkçe Soru-Cevap Veri Seti Bu veri seti, bir dil modelinin Türkçe biyoloji alanında ince ayar (fine-tune) edilmesi amacıyla hazırlanmıştır. Kaynağını MEB biyoloji ders kitaplarındaki terim ve tanımlar oluşturur. Her kayıt bir soru ve buna karşılık gelen tanımdan meydana gelir. Terim-tanım çiftleri soru-cevap biçimine dönüştürülmüş, soruların tek tipleşmemesi için farklı soru kalıpları ("... nedir", "... ne demek", "... açıklar mısın" vb.) kullanılmıştır.… See the full description on the dataset page: https://huggingface.co/datasets/nyzmemre/biyoloji-terimleri-turkce-sa.textquestion-answering1K<n<10K0 likes27 downloads2mo agoHugging Face23cakir61 /turkce-bet-asistantext10K<n<100K0 likes26 downloads25d agoHugging Face24Toivo0 /Turkce-istatistik-reasoning Türkçe İstatistik Muhakeme (Chain-of-Thought) Veri Seti Türkçe'de istatistik konularında düşünce zinciri (chain-of-thought) içeren, soru-cevap formatında bir fine-tuning veri seti. Her örnek, bir kullanıcı sorusu ve modelin hem iç muhakeme sürecini (thinking) hem de nihai cevabını içeren bir asistan yanıtından oluşan bir conversations listesidir. Veri Seti Özeti Toplam örnek sayısı 400 Dil Türkçe Kapsanan modül sayısı 7 Soru tipleri Kavramsal… See the full description on the dataset page: https://huggingface.co/datasets/Toivo0/Turkce-istatistik-reasoning.texttext-generationn<1K0 likes25 downloads2mo agoHugging Face25cakir61 /turkce-bet-asistan-v2text10K<n<100K0 likes25 downloads25d agoHugging Face26aiprojecom /turkce-otomobil-bakim-soru-cevap Türkçe Otomobil Bakımı Soru-Cevap Veriseti Bu veriseti otomobil bakımı, arıza ve sorunları hakkında Türkçe soru-cevap çiftleri içerir. Format: Parquet Not: Verisette hatalar ve eksiklikler bulunabilir. Katkı ve düzeltmeler için pull request açabilirsiniz. question-answering2 likes23 downloads5mo agoHugging Face27Karayel-DDI /Turkce_Lighteval_MATH-Hard This dataset is a machine-translated version of lighteval/MATH-Hard. We translated it using machine translation for the Teknofest 2024 Natural Language Processing competition. text1K<n<10K0 likes22 downloads2y agoHugging Face28habanoz /WildChat-turkce-expanded-messagestext10K<n<100K0 likes22 downloads1y agoHugging Face29aiprojecom /turkce-sentetik-otomotiv-yedek-parca-akil-yurutme Türkçe Otomobil Yedek Parça Soru-Cevap Akıl Yürütme Veri Seti Bu veri seti, Türkçe otomobil yedek parça sorguları üzerine akıl yürütme (reasoning) yoluyla cevap vermek amacıyla tasarlanmış yapay zeka eğitim verisidir. Sorgular ağırlıklı olarak Opel marka araçlar için yedek parça sorularından oluşmakta olup, diğer markalar için de örnekler içermektedir. İçerik Özellik Değer Toplam Satır ~990 Dil Türkçe Lisans MIT Format JSONL Veri Yapısı… See the full description on the dataset page: https://huggingface.co/datasets/aiprojecom/turkce-sentetik-otomotiv-yedek-parca-akil-yurutme.question-answering1 likes22 downloads5mo agoHugging Face30ceyyyh /turkce_masallarlicense: cc0-1.0 language: tr tags: art folklore stories size_categories: 1K<n<10K sources: https://www.masaloku.net/ https://www.kisamasaloku.com/ https://www.masalsitesi.com/ https://www.uykumasallari.com/ dataset_description: short: "Çocukluğun sıcaklığını taşıyan Türkçe masallar. Yaratıcı dil çalışmaları ve model eğitimi için uygun." long: | Kısa ve orta uzunlukta Türkçe masallar içerir. Anadolu anlatı geleneğini yansıtır. Kamu malı veya paylaşılmaya uygun kaynaklardan derlenmiştir.… See the full description on the dataset page: https://huggingface.co/datasets/ceyyyh/turkce_masallar.text1K<n<10K1 likes20 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.