caveman273/swe-11k
SWE-11K This dataset is generated from https://github.com/sdrobac/ijdar-2020. Quick Start from datasets import load_dataset dataset = load_dataset("parquet", data_files="train.parquet", split="train") Dataset Description SWE-11K is a Swedish OCR dataset containing 11,094 image-text pairs extracted from historic Swedish newspapers and journals. Suitable for training and evaluating OCR models on Swedish historical text. Supported Tasks… See the full description on the dataset page: https://huggingface.co/datasets/caveman273/swe-11k.
SWE-11K
This dataset is generated from https://github.com/sdrobac/ijdar-2020.
Quick Start
from datasets import load_dataset
dataset = load_dataset("parquet", data_files="train.parquet", split="train")Dataset Description
SWE-11K is a Swedish OCR dataset containing 11,094 image-text pairs extracted from historic Swedish newspapers and journals. Suitable for training and evaluating OCR models on Swedish historical text.
Supported Tasks
- Optical Character Recognition (OCR): Recognizing text from line-level images
Languages
Swedish (sv)
Dataset Structure
Data Fields
Data Splits
Example
{
"file_name": "0355-0257_1866_6__P100_TL00024",
"image": {"bytes": b"...", "path": "images/0355-0257_1866_6__P100_TL00024.bin.png"},
"text": "endast nisu hvete och ohra, otra korn (bjugg) vara genuint fin-"
}Licensing
CC-BY 4.0
Citation
@misc{swe11k,
title={Swedish OCR Dataset},
author={Drobac, Senka and Kauppinen, Pekka and Lindén, Krister},
year={2024}
}