CoolFace
Datasetpublic

GoktugD/turkish-topic-classification-1.5m

Turkish Topic Classification 1.5M v2 Yirmi konu için anahtar sözcük çeşitlendirmeli Türkçe belge sınıflandırma verisi. Doğrulanmış boyut Train: 1,470,000 Validation: 15,000 Test: 15,000 Toplam: 1,500,000 Ana görev sütunları: id, text, label Provenance Veri insan mesajlarından, belgelerinden veya web kazımasından alınmamıştır. Tamamı depodaki üretici koduyla deterministik olarak oluşturulur. Her satırda source_type, provenance, generator_version… See the full description on the dataset page: https://huggingface.co/datasets/GoktugD/turkish-topic-classification-1.5m.

sourceHugging Facecc0-1.0updated 1mo agoView on Hugging Face
0likes270downloads
Dataset Card

Turkish Topic Classification 1.5M v2

Yirmi konu için anahtar sözcük çeşitlendirmeli Türkçe belge sınıflandırma verisi.

Doğrulanmış boyut

  • Train: 1,470,000
  • Validation: 15,000
  • Test: 15,000
  • Toplam: 1,500,000
  • Ana görev sütunları: id, text, label

Provenance

Veri insan mesajlarından, belgelerinden veya web kazımasından alınmamıştır. Tamamı depodaki üretici koduyla deterministik olarak oluşturulur. Her satırda sourcetype, provenance, generatorversion, generatorsha256, generationseed, templateid, splitgroup ve record_fingerprint alanları bulunur. Üretici sürümü: 2.0.0. Üretici SHA-256: 38b7e8061db2634a80d7f77ee75d8eeed3bccf7a30e29407dd79fd87f4d5cf6c.

Split politikası

Kişi, şehir, kurum, nesne, zaman ifadesi ve bağlam şablonu havuzları train, validation ve test arasında ayrılmıştır. Değerlendirme split'leri eğitimde görülmeyen birincil varlık ve bağlam şablonlarını kullanır. Sayı ve tarih veri setlerinde ise mod-100 tabanlı hash-stratified ayırma uygulanır: 0–97 train, 98 validation, 99 test. Kesin içerik parmak izleri split'ler arasında çakışamaz.

Deduplication ve contamination

recordfingerprint; kimlik ve provenance alanları çıkarıldıktan, Unicode NFC, casefold, boşluk normalizasyonu ve sentetik kimlik maskelemesi uygulandıktan sonra SHA-256 ile hesaplanır. Tam dedup, split leakage, yakın-benzerlik örneklemesi ve haricî benchmark contamination sonuçları QUALITYREPORT.md dosyasında yayımlanır.

Lisans

Üretici ve ortaya çıkan sentetik veri CC0-1.0 olarak sunulur. Haricî benchmark metinleri bu depoya kopyalanmaz; yalnızca contamination denetiminde hash/benzerlik karşılaştırması için kullanılır.

Sınırlamalar

Bu büyük, kontrollü bir sentetik veri setidir; gerçek Türkçe kullanımının bütün bölgesel, toplumsal ve söylemsel çeşitliliğini temsil etmez. Şablon yapısı ölçülebilir biçimde mevcuttur. Bağımsız insan değerlendirmesi yapılmamıştır; model-assisted örnek incelemesi insan anotasyonu olarak sunulmaz. Yüksek riskli kullanım için tek başına uygun değildir.

Raporlar

  • Datasheet
  • Provenance ve yeniden üretilebilirlik
  • Kalite ve contamination raporu
  • Makine tarafından okunabilir metrikler
  • Sabitlenmiş contamination kaynakları