CoolFace
Datasetpublic

Werea-co/werea-tr-doc-ocr-synthetic

Werea Turkish Enterprise Documents 📄🇹🇷 Türkçe kurumsal belge OCR eğitimi için tamamı sentetik sayfa görüntüleri ve birebir eşleşen markdown ground-truth metinleri. Werea tarafından Werea-DocOCR modellerinin eğitimi için üretilmiştir. Belge türleri Tür Train Test İçerik Genel vekaletname 500 50 Noter başlığı, taraflar, yetki maddeleri, noter şerhi DASK poliçesi 500 50 Poliçe/sigortalı/bina bilgileri, prim tablosu e-Arşiv fatura 500 50 Satıcı/alıcı… See the full description on the dataset page: https://huggingface.co/datasets/Werea-co/werea-tr-doc-ocr-synthetic.

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes442downloads
Dataset Card

Werea Turkish Enterprise Documents 📄🇹🇷

Türkçe kurumsal belge OCR eğitimi için tamamı sentetik sayfa görüntüleri ve birebir eşleşen markdown ground-truth metinleri. Werea tarafından Werea-DocOCR modellerinin eğitimi için üretilmiştir.

Belge türleri

TürTrainTestİçerik
Genel vekaletname50050Noter başlığı, taraflar, yetki maddeleri, noter şerhi
DASK poliçesi50050Poliçe/sigortalı/bina bilgileri, prim tablosu
e-Arşiv fatura50050Satıcı/alıcı, kalem tablosu, KDV özeti
Konut kira sözleşmesi50050Taraflar, maddeler, imza blokları
Banka dekontu50050Havale/EFT/FAST işlem alanları, IBAN
Tapu senedi50050Ada/parsel, malik tablosu, tescil bilgileri
  • Görüntü: A4, ~150 DPI JPEG; tarama benzeri artefaktlar (hafif dönme, gürültü, bulanıklık, parlaklık/kontrast, imza karalaması, kaşe)
  • Ground truth: text alanında okuma sırasına göre markdown (başlıklar, anahtar-değer satırları ve markdown tabloları)
  • `doc_type` alanı belge türünü verir

Etik ve köken

Bu veri setindeki hiçbir belge gerçek değildir. Tüm ad-soyad, adres, kurum ve tutarlar rastgele üretilmiştir. T.C. kimlik numaraları kasıtlı olarak geçersiz checksum taşır, IBAN'lar geçersiz kontrol basamağı (TR00) kullanır; gerçek bir kişi veya hesapla eşleşmeleri matematiksel olarak engellenmiştir. Üretici script veri setiyle birlikte (scripts/werea_doc_gen.py) yayınlanmıştır.

Kullanım

python
from datasets import load_dataset

ds = load_dataset("Werea-co/werea-tr-doc-ocr-synthetic", split="train")
print(ds[0]["doc_type"])
print(ds[0]["text"][:300])

Lisans

Apache-2.0 — atıf: Werea-co/werea-tr-doc-ocr-synthetic.

<div align="center"> <sub>💜 <a href="https://werea.co">werea.co</a> — Fikirden üretime.</sub> </div>