CoolFace
Datasetpublic

avishadilhara/sinhala-ocr-lk-acts-1010

๐Ÿ‡ฑ๐Ÿ‡ฐ Sinhala OCR - Sri Lankan Acts Dataset Dataset Description This dataset contains 1,010 scanned document images of Sri Lankan legal acts (1980s-2010s) in Sinhala language with ground truth text annotations for Optical Character Recognition (OCR) training and evaluation. Key Features โœ… High-quality scanned document images โœ… Professionally corrected ground truth text โœ… Year-wise metadata for temporal analysis โœ… Pre-split into train/eval/test setsโ€ฆ See the full description on the dataset page: https://huggingface.co/datasets/avishadilhara/sinhala-ocr-lk-acts-1010.

sourceHugging Facecc-by-4.0updated 3mo agoView on Hugging Face
1likes148downloads
Dataset Card

๐Ÿ‡ฑ๐Ÿ‡ฐ Sinhala OCR - Sri Lankan Acts Dataset

Dataset Description

This dataset contains 1,010 scanned document images of Sri Lankan legal acts (1980s-2010s) in Sinhala language with ground truth text annotations for Optical Character Recognition (OCR) training and evaluation.

Key Features

  • โ€”โœ… High-quality scanned document images
  • โ€”โœ… Professionally corrected ground truth text
  • โ€”โœ… Year-wise metadata for temporal analysis
  • โ€”โœ… Pre-split into train/eval/test sets
  • โ€”โœ… Suitable for document OCR and layout analysis

Dataset Summary

PropertyValue
LanguageSinhala (เทƒเท’เถ‚เท„เถฝ)
TaskOptical Character Recognition (OCR)
Total Samples1,010
Document TypeLegal Acts (Printed)
Time Period1980s - 2010s
Image FormatPNG
Text EncodingUTF-8

Dataset Structure

Data Splits

SplitSamplesPurpose
Train707
Eval101
Test202

Data Fields

  • โ€”`image` (PIL.Image): Scanned page image in PNG format
  • โ€”`text` (string): Ground truth Sinhala text (OCR target)
  • โ€”`year` (string): Year of the document (1980-2019)
  • โ€”`doc_id` (string): Document identifier
  • โ€”`page_num` (string): Page number within document
  • โ€”`filename` (string): Original filename for reference

Year Distribution (Training Set)

  • โ€”1981: 76 samples
  • โ€”1982: 26 samples
  • โ€”1983: 10 samples
  • โ€”1984: 7 samples
  • โ€”1985: 7 samples
  • โ€”1986: 16 samples
  • โ€”1987: 43 samples
  • โ€”1988: 96 samples
  • โ€”1989: 8 samples
  • โ€”2000: 57 samples
  • โ€”2001: 22 samples
  • โ€”2002: 13 samples
  • โ€”2003: 14 samples
  • โ€”2004: 12 samples
  • โ€”2005: 16 samples
  • โ€”2006: 13 samples
  • โ€”2007: 23 samples
  • โ€”2008: 22 samples
  • โ€”2009: 23 samples
  • โ€”2010: 29 samples
  • โ€”2011: 70 samples
  • โ€”2012: 9 samples
  • โ€”2013: 10 samples
  • โ€”2014: 13 samples
  • โ€”2015: 9 samples
  • โ€”2016: 13 samples
  • โ€”2017: 20 samples
  • โ€”2018: 14 samples
  • โ€”2019: 16 samples

Applications This dataset is suitable for:

๐Ÿ“„ Document OCR: Training models for Sinhala document recognition

๐Ÿ” Layout Analysis: Understanding document structure

๐Ÿ“Š Temporal Analysis: Studying OCR performance across decades

๐ŸŒ Low-resource NLP: Expanding Sinhala language resources

๐Ÿ›๏ธ Digital Archiving: Digitizing historical legal documents

Citation If you use this dataset in your research, cite:

bibtex
@misc{dilhara2026crosstemporalsinhalaocrpagelevel,
      title={Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis}, 
      author={Avisha Dilhara and Nevidu Jayatilleke},
      year={2026},
      eprint={2606.29378},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={[https://arxiv.org/abs/2606.29378](https://arxiv.org/abs/2606.29378)}
}

This dataset is released under CC-BY-4.0 license.

Version History v1.0 (2026-01): Initial release with 1,010 samples

Pre-split into train/eval/test sets

Year-wise metadata included

Keywords: OCR, Sinhala, Sri Lanka, NLP, Computer Vision, Historical Documents, Legal Documents