CoolFace
Datasetpublic

kilicai/turkish-sft-from-scratch-120k

Turkish SFT From Scratch 120K Sıfırdan üretilmiş, kategori kontrollü Türkçe SFT dataset'i. Eski/temizlenmiş datasetlerden satır kopyalanmadı. Kapsam 12 kategori x 10,000 örnek = 120,000 örnek: instruction-following qa summarization cot multi-turn-dialogue rewriting text-classification error-correction formal-writing translation code-explanation creative-writing Doğrulamalar Canonical messages formatı: system/user/assistant. Exact duplicate hash… See the full description on the dataset page: https://huggingface.co/datasets/kilicai/turkish-sft-from-scratch-120k.

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes36downloads
Dataset Card

Turkish SFT From Scratch 120K

Sıfırdan üretilmiş, kategori kontrollü Türkçe SFT dataset'i. Eski/temizlenmiş datasetlerden satır kopyalanmadı.

Kapsam

12 kategori x 10,000 örnek = 120,000 örnek:

  • —instruction-following
  • —qa
  • —summarization
  • —cot
  • —multi-turn-dialogue
  • —rewriting
  • —text-classification
  • —error-correction
  • —formal-writing
  • —translation
  • —code-explanation
  • —creative-writing

Doğrulamalar

  • —Canonical messages formatı: system/user/assistant.
  • —Exact duplicate hash kontrolü.
  • —NSFW/toksik kelime filtresi.
  • —CoT matematik cevapları #### answer ile assertion doğrulamalı.
  • —Multi-turn örneklerde en az 3 user + 3 assistant turu.

Audit

json
{
  "rows": 120000,
  "categories": {
    "instruction-following": 10000,
    "qa": 10000,
    "summarization": 10000,
    "cot": 10000,
    "multi-turn-dialogue": 10000,
    "rewriting": 10000,
    "text-classification": 10000,
    "error-correction": 10000,
    "formal-writing": 10000,
    "translation": 10000,
    "code-explanation": 10000,
    "creative-writing": 10000
  },
  "bad_generated": 0,
  "duplicates_skipped": 0,
  "exact_duplicates_final": 0,
  "safety_hits_final": 0,
  "cot_bad_answers": 0,
  "multi_turn_bad": 0
}

Kullanım

python
from datasets import load_dataset

ds = load_dataset("kilicai/turkish-sft-from-scratch-120k", split="train")

<!-- ml-intern-provenance -->

Generated by ML Intern

This dataset repository was generated by ML Intern, an agent for machine learning research and development on the Hugging Face Hub.

  • —Try ML Intern: https://smolagents-ml-intern.hf.space
  • —Source code: https://github.com/huggingface/ml-intern

Usage

python
from datasets import load_dataset

dataset = load_dataset('kilicai/turkish-sft-from-scratch-120k')