avishadilhara/sinhala-ocr-lk-acts-1010
๐ฑ๐ฐ Sinhala OCR - Sri Lankan Acts Dataset Dataset Description This dataset contains 1,010 scanned document images of Sri Lankan legal acts (1980s-2010s) in Sinhala language with ground truth text annotations for Optical Character Recognition (OCR) training and evaluation. Key Features โ High-quality scanned document images โ Professionally corrected ground truth text โ Year-wise metadata for temporal analysis โ Pre-split into train/eval/test setsโฆ See the full description on the dataset page: https://huggingface.co/datasets/avishadilhara/sinhala-ocr-lk-acts-1010.
๐ฑ๐ฐ Sinhala OCR - Sri Lankan Acts Dataset
Dataset Description
This dataset contains 1,010 scanned document images of Sri Lankan legal acts (1980s-2010s) in Sinhala language with ground truth text annotations for Optical Character Recognition (OCR) training and evaluation.
Key Features
- โ High-quality scanned document images
- โ Professionally corrected ground truth text
- โ Year-wise metadata for temporal analysis
- โ Pre-split into train/eval/test sets
- โ Suitable for document OCR and layout analysis
Dataset Summary
Dataset Structure
Data Splits
Data Fields
- `image` (
PIL.Image): Scanned page image in PNG format - `text` (
string): Ground truth Sinhala text (OCR target) - `year` (
string): Year of the document (1980-2019) - `doc_id` (
string): Document identifier - `page_num` (
string): Page number within document - `filename` (
string): Original filename for reference
Year Distribution (Training Set)
- 1981: 76 samples
- 1982: 26 samples
- 1983: 10 samples
- 1984: 7 samples
- 1985: 7 samples
- 1986: 16 samples
- 1987: 43 samples
- 1988: 96 samples
- 1989: 8 samples
- 2000: 57 samples
- 2001: 22 samples
- 2002: 13 samples
- 2003: 14 samples
- 2004: 12 samples
- 2005: 16 samples
- 2006: 13 samples
- 2007: 23 samples
- 2008: 22 samples
- 2009: 23 samples
- 2010: 29 samples
- 2011: 70 samples
- 2012: 9 samples
- 2013: 10 samples
- 2014: 13 samples
- 2015: 9 samples
- 2016: 13 samples
- 2017: 20 samples
- 2018: 14 samples
- 2019: 16 samples
Applications This dataset is suitable for:
๐ Document OCR: Training models for Sinhala document recognition
๐ Layout Analysis: Understanding document structure
๐ Temporal Analysis: Studying OCR performance across decades
๐ Low-resource NLP: Expanding Sinhala language resources
๐๏ธ Digital Archiving: Digitizing historical legal documents
Citation If you use this dataset in your research, cite:
@misc{dilhara2026crosstemporalsinhalaocrpagelevel,
title={Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis},
author={Avisha Dilhara and Nevidu Jayatilleke},
year={2026},
eprint={2606.29378},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={[https://arxiv.org/abs/2606.29378](https://arxiv.org/abs/2606.29378)}
}
This dataset is released under CC-BY-4.0 license.
Version History v1.0 (2026-01): Initial release with 1,010 samples
Pre-split into train/eval/test sets
Year-wise metadata included
Keywords: OCR, Sinhala, Sri Lanka, NLP, Computer Vision, Historical Documents, Legal Documents
