Bahadir26/turkce-master-dataset-1280-capped
Turkce Master Dataset 1280 Capped Egitim maliyetini kontrol etmek icin Qwen/Qwen3.5-2B tokenizer'i ile 1280 token ustundeki ornekler veri setine alinmadi. Istatistikler Alan Deger Base kaynaktan eklenen 69729 Ek kaynaktan eklenen 40411 Filtrelenen (>1280 token) 6198 Son toplam 103942 Ortalama token 573.84 Min token 61 Max token 1280 P90 token 1051 P95 token 1142 Format Her satir bir JSON nesnesidir:… See the full description on the dataset page: https://huggingface.co/datasets/Bahadir26/turkce-master-dataset-1280-capped.
Turkce Master Dataset 1280 Capped
Egitim maliyetini kontrol etmek icin Qwen/Qwen3.5-2B tokenizer'i ile 1280 token ustundeki ornekler veri setine alinmadi.
Istatistikler
Format
Her satir bir JSON nesnesidir:
{"messages":[{"role":"system","content":"..."},{"role":"user","content":"..."},{"role":"assistant","content":"..."}],"tags":["..."]}Kullanim
from datasets import load_dataset
dataset = load_dataset("Bahadir26/turkce-master-dataset-1280-capped")