avometre/turkish-wikipedia-qa
Turkish Wikipedia Q&A Türkçe Vikipedi paragraflarından türetilmiş Türkçe Soru‑Cevap (Q&A) veri seti. Her kayıtta kaynak başlık/URL ve lisans bilgisi bulunur. Veri seti türev çalışmadır; CC BY‑SA 3.0 şartları (attribution + share‑alike) geçerlidir. Dataset Details Dataset Sources Kaynak metin: Turkish Wikipedia (trwiki) — Wikimedia Dumps üzerinden alınan içerik. Bağlantı (genel): https://dumps.wikimedia.org/ Uses Direct… See the full description on the dataset page: https://huggingface.co/datasets/avometre/turkish-wikipedia-qa.
Turkish Wikipedia Q&A
Türkçe Vikipedi paragraflarından türetilmiş Türkçe Soru‑Cevap (Q&A) veri seti. Her kayıtta kaynak başlık/URL ve lisans bilgisi bulunur. Veri seti türev çalışmadır; CC BY‑SA 3.0 şartları (attribution + share‑alike) geçerlidir.
Dataset Details
Dataset Description
- Amaç: TR Vikipedi paragraflarından eğitim ve değerlendirme için Q&A çiftleri üretmek.
- İçerik: question, answer, sourcetitle, sourceurl, license, paragraph_index alanları.
- Boyut (bu sürüm): ~156,675 satır (JSONL birleştirilmiş dosya örneği).
- Üretim: Tamamen otomatik bir işleme hattı ile oluşturulmuştur (metin çıkarımı → paragraf hazırlama → Soru‑Cevap üretimi → kalite filtresi ve deduplikasyon). İnsan anotasyonu yoktur.
- Curated by: avometre
- Shared by: avometre
- Language(s) (NLP): tr
- License: CC BY‑SA 3.0
Dataset Sources
- Kaynak metin: Turkish Wikipedia (trwiki) — Wikimedia Dumps üzerinden alınan içerik.
- Bağlantı (genel): https://dumps.wikimedia.org/
Uses
Direct Use
- Türkçe Q&A eğitimi (SFT/finetuning) ve değerlendirme
- Veri artırımı ve RAG senaryolarında Soru‑Cevap örnek bankası
Out‑of‑Scope Use
- Paragraf dışı bilgi gerektiren doğruluk testleri veya kritik karar destek uygulamaları
- Tıbbi/finansal/hukuki alanlarda doğrulama olmadan doğrudan kullanım
- CC BY‑SA atıf ve ShareAlike koşullarını göz ardı eden dağıtımlar
Dataset Structure
- Biçim: JSONL (satır başına bir örnek) sürümü
- Alanlar:
question: stringanswer: stringsource_title: stringsource_url: stringlicense: string (ör. "CC BY‑SA 3.0")paragraph_index: integer- Bölmeler: Bu sürümde resmi split yok; kullanıcılar ihtiyacına göre bölebilir.
Dataset Creation
Curation Rationale
Türkçe dil alanında, kaynaklı (atıflı) ve geniş kapsamlı bir Soru‑Cevap veri seti oluşturmak.
Source Data
Data Collection and Processing
- TRWiki dump indirme → metin çıkarımı → paragraflara ayırma/temizlik → otomatik Q&A üretimi → kısa/tekrar eden örnekleri eleme ve normalizasyon.
- Temel filtreler: minimum soru/cevap uzunluğu, duplikasyon kontrolü, JSON biçim kontrolü.
Who are the source data producers?
- Wikipedia katkıcıları (kaynak metin)
- Otomatik sistem (Soru‑Cevap üretimi)
Annotations
Annotation process
- Otomatik üretim; insan anotasyonu yok. Biçim/doğruluk denetimi için kurallı filtreler uygulanmıştır.
Who are the annotators?
- Otomatik sistem (model tabanlı üretim)
Personal and Sensitive Information
- Vikipedi doğası gereği kişisel/biyografik bilgiler içerebilir. Veri, kaynakta yer aldığı şekliyle taşınır. Kritik uygulamalarda ek denetim önerilir.
Bias, Risks, and Limitations
- Vikipedi kapsam ve bakış açısı önyargıları yansıyabilir.
- Otomatik üretimde hatalar/eksikler olabilir; tüm alanlarda doğruluk garanti edilmez.
Recommendations
- Kritik kullanım öncesi ek doğrulama/insan denetimi yapınız.
- Kendi kalite eşiklerinize göre yeniden filtreleme (uzunluk, anahtar sözcük, kaynak)
- CC BY‑SA 3.0 gerekliliklerine (attribution + share‑alike) uyunuz.
Citation
- Wikipedia: "Contains content from Turkish Wikipedia, © Wikimedia contributors, CC BY‑SA 3.0."
- Dataset: avometre (2025). Turkish Wikipedia Q&A (TRWiki → Soru‑Cevap). CC BY‑SA 3.0.
Dataset Card Authors
- avometre
Dataset Card Contact
- Geri bildirim için depo/issues veya HF yorumları üzerinden iletişime geçebilirsiniz.
