datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
werea-tr-doc-ocr-enterprise-v2
Werea Turkish Enterprise Documents v2 📄🇹🇷
v1 setinin
enterprise sürümü: 12 belge türü × 3 çekim koşulu, 12.960 train + 900 test
sayfası. Werea-DocOCR v2 modellerinin eğitimi için üretilmiştir.
Belge türleri (12)
Genel vekaletname · DASK poliçesi · e-Arşiv fatura · Konut kira sözleşmesi ·
Banka dekontu · Tapu senedi · Maaş bordrosu · Kasko poliçesi · Araç tescil
bilgi formu · Resmî kurum yazısı · Ticaret sicil ilanı · SGK hizmet dökümü
Çekim… See the full description on the dataset page: https://huggingface.co/datasets/Werea-co/werea-tr-doc-ocr-enterprise-v2.werea-tr-doc-ocr-synthetic
Werea Turkish Enterprise Documents 📄🇹🇷
Türkçe kurumsal belge OCR eğitimi için tamamı sentetik sayfa görüntüleri ve
birebir eşleşen markdown ground-truth metinleri. Werea
tarafından Werea-DocOCR modellerinin eğitimi için üretilmiştir.
Belge türleri
Tür
Train
Test
İçerik
Genel vekaletname
500
50
Noter başlığı, taraflar, yetki maddeleri, noter şerhi
DASK poliçesi
500
50
Poliçe/sigortalı/bina bilgileri, prim tablosu
e-Arşiv fatura
500
50
Satıcı/alıcı… See the full description on the dataset page: https://huggingface.co/datasets/Werea-co/werea-tr-doc-ocr-synthetic.Werea-KVKK-Bench
Werea-KVKK-Bench v2
Synthetic, reproducible data and benchmark assets for evidence-first Turkish
privacy operations.
Contents
pii_synthetic.jsonl: fictional Turkish PII spans;
workflow_sft.jsonl: structured workflow-assistant conversations;
cases.jsonl: frozen rules/deadline/PII evaluation cases;
kvkk_rules.json: human-approval workflow definitions;
kvkk_controls.json: evidence-based institutional control catalog;
pii_taxonomy.json: Turkish… See the full description on the dataset page: https://huggingface.co/datasets/Werea-co/Werea-KVKK-Bench.werea-tts-tr-synthetic
Werea TTS TR Synthetic 🎙️🇹🇷
Werea-TSS modelinin eğitiminde
kullanılan, tamamı sentetik Türkçe metinden-sese veri seti. İzinsiz gerçek kişi
kaydı veya ses klonlama verisi içermez; tüm sesler
FreyaTTS-small öğretmen
modelinden sabit 20260814 tohumu ile üretilmiştir. Metinler Werea için özgün
olarak yazılmıştır.
İçerik
Split
Örnek
Süre
Açıklama
train
1.272
~1,32 saat
960 tam cümle (subset=stage1) + 312 kısa ifade (subset=short)
test
20
~76 sn
Eğitimle… See the full description on the dataset page: https://huggingface.co/datasets/Werea-co/werea-tts-tr-synthetic.werea-secassist-tr
