CoolFace
Datasetpublic

onkanat/scientific-systems-sft-dpo-distilled

Scientific and Systems Distillation Golden Dataset (SFT & DPO) Bu veri seti, temel ve uygulamalı bilimler ile yüksek başarımlı hesaplama (HPC) ve Linux sistem mühendisliği alanlarında yapay zeka modellerini ince ayar (fine-tuning) ve tercih hizalama (preference alignment) süreçlerine tabi tutmak amacıyla tasarlanmış, 2.551 adet ileri düzey teknik prompt ve bunlara karşılık gelen yüksek kaliteli model çıktılarından derlenmiş zengin bir sentetik veri kümesidir. 🚀 Veri… See the full description on the dataset page: https://huggingface.co/datasets/onkanat/scientific-systems-sft-dpo-distilled.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes677downloads
Dataset Card

Scientific and Systems Distillation Golden Dataset (SFT & DPO)

Bu veri seti, temel ve uygulamalı bilimler ile yüksek başarımlı hesaplama (HPC) ve Linux sistem mühendisliği alanlarında yapay zeka modellerini ince ayar (fine-tuning) ve tercih hizalama (preference alignment) süreçlerine tabi tutmak amacıyla tasarlanmış, 2.551 adet ileri düzey teknik prompt ve bunlara karşılık gelen yüksek kaliteli model çıktılarından derlenmiş zengin bir sentetik veri kümesidir.

🚀 Veri Seti Mimarisi ve Üretim Yöntemi

Veri setinin üretimi ve kalite güvencesi üç ana aşamadan oluşmaktadır:

  1. 1.İleri Düzey Prompt Tasarımı: GEMINI.md kuralları çerçevesinde akademik dil, zengin LaTeX formülleri, teknik tablolar ve Markdown wiki yapısını şart koşan 2.551 adet benzersiz yönerge tasarlanmıştır.
  2. 2.Çoklu Model Çıktı Üretimi: Tasarlanan promptlar bulut tabanlı gemini-2.5-flash ve yerel sunucu tabanlı gemma4:31b ile nemotron-cascade-2:30b modelleri üzerinden işlenmiş ve çıktılar toplanmıştır.
  3. 3.Hakem Model ve DPO Değerlendirmesi: Yerel olarak çalışan qwen3-coder:30b (LLM-as-a-Judge) modeli, 5 bağımsız ölçüt (Talimat Kapsama, Format Uyumu, Dil/Üslup, Yapısal Bütünlük, Sapma/Gürültü) üzerinden model çıktılarını 25 tam puan üzerinden değerlendirmiş, puan farkı $\ge 2$ olan kazanan ve elenen yanıtları belirleyerek 5.794 adet DPO tercih çifti oluşturmuştur.
  4. 4.Altın SFT Derlemesi (DPO-Chosen Golden SFT): Tercih ikililerindeki en yüksek puanlı (ortalama hakem puanı: 24.93 / 25.00) champion yanıtlar ayıklanarak 2.495 adet kusursuz rasyonel SFT çıktısından oluşan Altın Veri Seti derlenmiştir.

📊 Veri Seti İstatistikleri

1. Genel Dağılım

  • —Toplam Benzersiz Altın SFT Satırı: 2495
  • —Toplam Değerlendirilen DPO Tercih Çifti: 5794
  • —Ortalama Hakem Kalite Puanı: 24.93 / 25.00

2. Model Bazlı Kazanan Dağılımı (Altın SFT)

ModelKazandığı Kayıt SayısıOran
gemini-2.5-flash2226 adet89.2%
gemma4:31b212 adet8.5%
nemotron-cascade-2:30b57 adet2.3%

3. Kategori Bazlı Veri Dağılımı

KategoriSFT Kayıt SayısıDPO Çift SayısıDurum
Matematik198509🟢 %100 Başarılı
Linux-Man-Sayfalari196436🟢 %100 Başarılı
Linux-Kernel-Gelistirme192386🟢 %100 Başarılı
Fortran199454🟢 %100 Başarılı
Fizik197546🟢 %100 Başarılı
Linux-Cluster-Ve-Hpc0438🟢 %100 Başarılı
Hpc0451🟢 %100 Başarılı
Kimya198484🟢 %100 Başarılı
Biyoloji197513🟢 %100 Başarılı
Linux-Sistem-Yonetimi195405🟢 %100 Başarılı
Türkçe140321🟢 %100 Başarılı
Octave-Matlab197440🟢 %100 Başarılı
Paralel-Programlama191411🟢 %100 Başarılı
Linux-Cluster-ve-HPC1980🟢 %100 Başarılı
HPC1970🟢 %100 Başarılı

📂 Veri Formatı Şablonları

A. SFT (Alpaca Formatı)

json
{
  "instruction": "<prompt talimat metni>",
  "input": "",
  "output": "<modelin akademik ve format uyumlu çıktısı>",
  "metadata": {
    "discipline": "Matematik",
    "topic_id": "001",
    "model_chosen": "gemini-2.5-flash",
    "total_score": 25,
    "scores_chosen": {
      "talimat_kapsama": 5,
      "format_uyumu": 5,
      "dil_ustup": 5,
      "yapisal_butunluk": 5,
      "sapma_gurultu": 5
    },
    "judge_model": "qwen3-coder:30b"
  }
}

B. DPO (Nested Preference Formatı)

json
{
  "prompt": "<orijinal prompt talimat metni>",
  "chosen": "<hakem model tarafından seçilen yüksek puanlı model çıktısı>",
  "rejected": "<hakem model tarafından elenen düşük puanlı model çıktısı>",
  "metadata": {
    "discipline": "HPC",
    "topic_id": "001",
    "model_chosen": "gemini-2.5-flash",
    "model_rejected": "gemma431b",
    "scores_chosen": {
      "talimat_kapsama": 5,
      "format_uyumu": 5,
      "dil_ustup": 5,
      "yapisal_butunluk": 5,
      "sapma_gurultu": 5
    },
    "scores_rejected": {
      "talimat_kapsama": 2,
      "format_uyumu": 2,
      "dil_ustup": 3,
      "yapisal_butunluk": 2,
      "sapma_gurultu": 3
    },
    "reason_rejected": "Gerekçe açıklaması...",
    "comparison": "Kıyaslama özeti...",
    "judge_model": "qwen3-coder:30b"
  }
}

🤝 İlgili Projeler ve Atıflar (Related Projects & Citations)

Bu veri setinin Türkçe dil ve anlatım dikeyindeki yüksek kaliteli gelişiminde, Türkiye açık kaynak doğal dil işleme ekosistemine liderlik eden [turkish-nlp-suite](https://huggingface.co/turkish-nlp-suite) topluluğunun yürüttüğü vizyoner çalışmalardan ilham alınmıştır.

BibTeX Citations

Kendi akademik veya ticari çalışmalarınızda bu veri setini referans göstermek isterseniz aşağıdaki BibTeX bloklarını kullanabilirsiniz:

Kendi Veri Setimiz İçin:
latex
@misc{scientific-systems-sft-dpo-distilled,
  title        = {Scientific and Systems Distillation Golden Dataset (SFT & DPO)},
  author       = {Kılıçaslan, Hakan and Kanat, Onur},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/onkanat/scientific-systems-sft-dpo-distilled}},
  note         = {Accessed: 2026-05-26}
}
İlham Alınan Proje (Turkish NLP Suite) İçin:
latex
@misc{turkish-nlp-suite,
  title        = {Turkish NLP Suite},
  author       = {{Duygu Altinok}},
  howpublished = {\url{https://huggingface.co/turkish-nlp-suite}},
  note         = {Accessed: 2026-04-06}
}

🛡️ Lisanslama ve Kullanım Kriterleri

Bu veri seti Apache-2.0 lisansı altında açık kaynak olarak dağıtılmaktadır. Üretilen verilerin tamamı sentetik olduğundan, ticari ve akademik araştırmalarda güvenle kullanılabilir. İnce ayar (fine-tuning) ve DPO hizalama süreçlerinde modelinize üst düzey teknik yetenekler kazandırır.