GoktugD/turkish-topic-classification-1.5m
Turkish Topic Classification 1.5M v2 Yirmi konu için anahtar sözcük çeşitlendirmeli Türkçe belge sınıflandırma verisi. Doğrulanmış boyut Train: 1,470,000 Validation: 15,000 Test: 15,000 Toplam: 1,500,000 Ana görev sütunları: id, text, label Provenance Veri insan mesajlarından, belgelerinden veya web kazımasından alınmamıştır. Tamamı depodaki üretici koduyla deterministik olarak oluşturulur. Her satırda source_type, provenance, generator_version… See the full description on the dataset page: https://huggingface.co/datasets/GoktugD/turkish-topic-classification-1.5m.
Turkish Topic Classification 1.5M v2
Yirmi konu için anahtar sözcük çeşitlendirmeli Türkçe belge sınıflandırma verisi.
Doğrulanmış boyut
- Train: 1,470,000
- Validation: 15,000
- Test: 15,000
- Toplam: 1,500,000
- Ana görev sütunları: id, text, label
Provenance
Veri insan mesajlarından, belgelerinden veya web kazımasından alınmamıştır. Tamamı depodaki üretici koduyla deterministik olarak oluşturulur. Her satırda sourcetype, provenance, generatorversion, generatorsha256, generationseed, templateid, splitgroup ve record_fingerprint alanları bulunur. Üretici sürümü: 2.0.0. Üretici SHA-256: 38b7e8061db2634a80d7f77ee75d8eeed3bccf7a30e29407dd79fd87f4d5cf6c.
Split politikası
Kişi, şehir, kurum, nesne, zaman ifadesi ve bağlam şablonu havuzları train, validation ve test arasında ayrılmıştır. Değerlendirme split'leri eğitimde görülmeyen birincil varlık ve bağlam şablonlarını kullanır. Sayı ve tarih veri setlerinde ise mod-100 tabanlı hash-stratified ayırma uygulanır: 0–97 train, 98 validation, 99 test. Kesin içerik parmak izleri split'ler arasında çakışamaz.
Deduplication ve contamination
recordfingerprint; kimlik ve provenance alanları çıkarıldıktan, Unicode NFC, casefold, boşluk normalizasyonu ve sentetik kimlik maskelemesi uygulandıktan sonra SHA-256 ile hesaplanır. Tam dedup, split leakage, yakın-benzerlik örneklemesi ve haricî benchmark contamination sonuçları QUALITYREPORT.md dosyasında yayımlanır.
Lisans
Üretici ve ortaya çıkan sentetik veri CC0-1.0 olarak sunulur. Haricî benchmark metinleri bu depoya kopyalanmaz; yalnızca contamination denetiminde hash/benzerlik karşılaştırması için kullanılır.
Sınırlamalar
Bu büyük, kontrollü bir sentetik veri setidir; gerçek Türkçe kullanımının bütün bölgesel, toplumsal ve söylemsel çeşitliliğini temsil etmez. Şablon yapısı ölçülebilir biçimde mevcuttur. Bağımsız insan değerlendirmesi yapılmamıştır; model-assisted örnek incelemesi insan anotasyonu olarak sunulmaz. Yüksek riskli kullanım için tek başına uygun değildir.
Raporlar
- Datasheet
- Provenance ve yeniden üretilebilirlik
- Kalite ve contamination raporu
- Makine tarafından okunabilir metrikler
- Sabitlenmiş contamination kaynakları
