onkanat/scientific-systems-sft-dpo-distilled
Scientific and Systems Distillation Golden Dataset (SFT & DPO) Bu veri seti, temel ve uygulamalı bilimler ile yüksek başarımlı hesaplama (HPC) ve Linux sistem mühendisliği alanlarında yapay zeka modellerini ince ayar (fine-tuning) ve tercih hizalama (preference alignment) süreçlerine tabi tutmak amacıyla tasarlanmış, 2.551 adet ileri düzey teknik prompt ve bunlara karşılık gelen yüksek kaliteli model çıktılarından derlenmiş zengin bir sentetik veri kümesidir. 🚀 Veri… See the full description on the dataset page: https://huggingface.co/datasets/onkanat/scientific-systems-sft-dpo-distilled.
Scientific and Systems Distillation Golden Dataset (SFT & DPO)
Bu veri seti, temel ve uygulamalı bilimler ile yüksek başarımlı hesaplama (HPC) ve Linux sistem mühendisliği alanlarında yapay zeka modellerini ince ayar (fine-tuning) ve tercih hizalama (preference alignment) süreçlerine tabi tutmak amacıyla tasarlanmış, 2.551 adet ileri düzey teknik prompt ve bunlara karşılık gelen yüksek kaliteli model çıktılarından derlenmiş zengin bir sentetik veri kümesidir.
🚀 Veri Seti Mimarisi ve Üretim Yöntemi
Veri setinin üretimi ve kalite güvencesi üç ana aşamadan oluşmaktadır:
- İleri Düzey Prompt Tasarımı:
GEMINI.mdkuralları çerçevesinde akademik dil, zengin LaTeX formülleri, teknik tablolar ve Markdown wiki yapısını şart koşan 2.551 adet benzersiz yönerge tasarlanmıştır. - Çoklu Model Çıktı Üretimi: Tasarlanan promptlar bulut tabanlı
gemini-2.5-flashve yerel sunucu tabanlıgemma4:31bilenemotron-cascade-2:30bmodelleri üzerinden işlenmiş ve çıktılar toplanmıştır. - Hakem Model ve DPO Değerlendirmesi: Yerel olarak çalışan
qwen3-coder:30b(LLM-as-a-Judge) modeli, 5 bağımsız ölçüt (Talimat Kapsama, Format Uyumu, Dil/Üslup, Yapısal Bütünlük, Sapma/Gürültü) üzerinden model çıktılarını 25 tam puan üzerinden değerlendirmiş, puan farkı $\ge 2$ olan kazanan ve elenen yanıtları belirleyerek 5.794 adet DPO tercih çifti oluşturmuştur. - Altın SFT Derlemesi (DPO-Chosen Golden SFT): Tercih ikililerindeki en yüksek puanlı (ortalama hakem puanı: 24.93 / 25.00) champion yanıtlar ayıklanarak 2.495 adet kusursuz rasyonel SFT çıktısından oluşan Altın Veri Seti derlenmiştir.
📊 Veri Seti İstatistikleri
1. Genel Dağılım
- Toplam Benzersiz Altın SFT Satırı: 2495
- Toplam Değerlendirilen DPO Tercih Çifti: 5794
- Ortalama Hakem Kalite Puanı: 24.93 / 25.00
2. Model Bazlı Kazanan Dağılımı (Altın SFT)
3. Kategori Bazlı Veri Dağılımı
📂 Veri Formatı Şablonları
A. SFT (Alpaca Formatı)
{
"instruction": "<prompt talimat metni>",
"input": "",
"output": "<modelin akademik ve format uyumlu çıktısı>",
"metadata": {
"discipline": "Matematik",
"topic_id": "001",
"model_chosen": "gemini-2.5-flash",
"total_score": 25,
"scores_chosen": {
"talimat_kapsama": 5,
"format_uyumu": 5,
"dil_ustup": 5,
"yapisal_butunluk": 5,
"sapma_gurultu": 5
},
"judge_model": "qwen3-coder:30b"
}
}B. DPO (Nested Preference Formatı)
{
"prompt": "<orijinal prompt talimat metni>",
"chosen": "<hakem model tarafından seçilen yüksek puanlı model çıktısı>",
"rejected": "<hakem model tarafından elenen düşük puanlı model çıktısı>",
"metadata": {
"discipline": "HPC",
"topic_id": "001",
"model_chosen": "gemini-2.5-flash",
"model_rejected": "gemma431b",
"scores_chosen": {
"talimat_kapsama": 5,
"format_uyumu": 5,
"dil_ustup": 5,
"yapisal_butunluk": 5,
"sapma_gurultu": 5
},
"scores_rejected": {
"talimat_kapsama": 2,
"format_uyumu": 2,
"dil_ustup": 3,
"yapisal_butunluk": 2,
"sapma_gurultu": 3
},
"reason_rejected": "Gerekçe açıklaması...",
"comparison": "Kıyaslama özeti...",
"judge_model": "qwen3-coder:30b"
}
}🤝 İlgili Projeler ve Atıflar (Related Projects & Citations)
Bu veri setinin Türkçe dil ve anlatım dikeyindeki yüksek kaliteli gelişiminde, Türkiye açık kaynak doğal dil işleme ekosistemine liderlik eden [turkish-nlp-suite](https://huggingface.co/turkish-nlp-suite) topluluğunun yürüttüğü vizyoner çalışmalardan ilham alınmıştır.
BibTeX Citations
Kendi akademik veya ticari çalışmalarınızda bu veri setini referans göstermek isterseniz aşağıdaki BibTeX bloklarını kullanabilirsiniz:
Kendi Veri Setimiz İçin:
@misc{scientific-systems-sft-dpo-distilled,
title = {Scientific and Systems Distillation Golden Dataset (SFT & DPO)},
author = {Kılıçaslan, Hakan and Kanat, Onur},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/onkanat/scientific-systems-sft-dpo-distilled}},
note = {Accessed: 2026-05-26}
}İlham Alınan Proje (Turkish NLP Suite) İçin:
@misc{turkish-nlp-suite,
title = {Turkish NLP Suite},
author = {{Duygu Altinok}},
howpublished = {\url{https://huggingface.co/turkish-nlp-suite}},
note = {Accessed: 2026-04-06}
}🛡️ Lisanslama ve Kullanım Kriterleri
Bu veri seti Apache-2.0 lisansı altında açık kaynak olarak dağıtılmaktadır. Üretilen verilerin tamamı sentetik olduğundan, ticari ve akademik araştırmalarda güvenle kullanılabilir. İnce ayar (fine-tuning) ve DPO hizalama süreçlerinde modelinize üst düzey teknik yetenekler kazandırır.
