turkce
Datasets
All datasets matching “turkce”turkce_karisikTurkce-Atlas-Instruct
Türkçe Atlas — Büyük Ölçekli Türkçe Instruct SFT Veri Kümesi
Türkçe Atlas, Türkçe komut takibi ve sohbet modeli eğitimi için hazırlanmış, konuşma biçiminde 336.146 örnek içeren bir denetimli ince ayar (Supervised Fine-Tuning, SFT) veri kümesidir. Her kayıt tek bir messages alanından oluşur ve sabit olarak system → user → assistant sırasındaki üç mesajı içerir.
60 kayıtlık düzenli örneklemde yeniden yazma, özetleme, soru-cevap, yapılandırılmış çıktı üretme, Türkçe dilbilgisi… See the full description on the dataset page: https://huggingface.co/datasets/AlicanKiraz0/Turkce-Atlas-Instruct.turkce-sft-qa-3.7m
🇹🇷 Turkish SFT/QA — Birleştirilmiş ve Tekrarsız Veri Seti
3,723,264 örnek. 24 açık Türkçe SFT/QA veri setinin, satır düzeyinde
tekrar temizliği ve kalite kontrolünden geçirilmiş birleşimi. Her satır hangi veri
setinden geldiğini taşır.
English: A merged, row-level deduplicated and quality-filtered collection of
24 open Turkish SFT/QA datasets (3,723,264 examples). Every row carries
its source dataset, source URL and original license.
🙏 Teşekkür /… See the full description on the dataset page: https://huggingface.co/datasets/MercanAI/turkce-sft-qa-3.7m.yapay_zeka_turkce_mmlu_liderlik_tablosu
Yapay Zeka Türkçe MMLU Liderlik Tablosu
Bu veri seti serisi, Türkiye’deki eğitim sisteminde kullanılan gerçek sorularla yapay zeka modellerinin Türkçedeki yeteneklerini değerlendirmeyi amaçlar. Çeşitli büyük dil modellerinin (LLM) Türkçe Massive Multitask Language Understanding (MMLU) benchmark'ı üzerindeki performansını değerlendirir ve sıralar. Bu veri seti, modellerin Türkçe anlama ve cevaplama yeteneklerini karşılaştırmak için kapsamlı bir bakış açısı sunar. Her modelin… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_liderlik_tablosu.yapay_zeka_turkce_mmlu_bolum_sonuclari
Yapay Zeka Türkçe MMLU Bölüm Sonuçları
Bu veri seti, Türkiye'deki eğitim sisteminde kullanılan 62 farklı kategoriden sorularla yapay zeka modellerinin bölüm bazında performansını ölçmektedir. Her bölüm, Türkiye'deki eğitim sisteminde kullanılan gerçek sorulardan 100 tanesini içerir ve toplamda 6200 soru bulunmaktadır. Her bölümdeki doğru cevap oranları detaylandırılarak modellerin hangi konularda daha başarılı olduğunu belirlemek amacıyla oluşturulmuştur.
Veri Setinin… See the full description on the dataset page: https://huggingface.co/datasets/alibayram/yapay_zeka_turkce_mmlu_bolum_sonuclari.turkce-kitap
🔥 TurkishLLaVA OCR Enhancement Dataset
This dataset is a specialized books collection designed to improve the Turkish OCR (Optical Character Recognition) abilities of the Turkish-LLaVA-v0.1 model. It was created by collecting 100,000 books entirely from Turkish sources. The primary goal of this dataset is to enhance the model's ability to detect and interpret any text present in images.
Dataset Usage in Finetuning
This dataset played a crucial role in the… See the full description on the dataset page: https://huggingface.co/datasets/ytu-ce-cosmos/turkce-kitap.
