CoolFace
Datasetpublic

caveman273/swe-11k

SWE-11K This dataset is generated from https://github.com/sdrobac/ijdar-2020. Quick Start from datasets import load_dataset dataset = load_dataset("parquet", data_files="train.parquet", split="train") Dataset Description SWE-11K is a Swedish OCR dataset containing 11,094 image-text pairs extracted from historic Swedish newspapers and journals. Suitable for training and evaluating OCR models on Swedish historical text. Supported Tasks… See the full description on the dataset page: https://huggingface.co/datasets/caveman273/swe-11k.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
0likes13downloads
Dataset Card

SWE-11K

This dataset is generated from https://github.com/sdrobac/ijdar-2020.

Quick Start

python
from datasets import load_dataset

dataset = load_dataset("parquet", data_files="train.parquet", split="train")

Dataset Description

SWE-11K is a Swedish OCR dataset containing 11,094 image-text pairs extracted from historic Swedish newspapers and journals. Suitable for training and evaluating OCR models on Swedish historical text.

Supported Tasks

  • —Optical Character Recognition (OCR): Recognizing text from line-level images

Languages

Swedish (sv)

Dataset Structure

Data Fields

FieldTypeDescription
file_namestringUnique sample identifier
imagedictImage data with bytes (PNG image data) and path (relative path)
textstringGround truth transcription

Data Splits

SplitSize
train11,094

Example

python
{
    "file_name": "0355-0257_1866_6__P100_TL00024",
    "image": {"bytes": b"...", "path": "images/0355-0257_1866_6__P100_TL00024.bin.png"},
    "text": "endast nisu hvete och ohra, otra korn (bjugg) vara genuint fin-"
}

Licensing

CC-BY 4.0

Citation

bibtex
@misc{swe11k,
  title={Swedish OCR Dataset},
  author={Drobac, Senka and Kauppinen, Pekka and Lindén, Krister},
  year={2024}
}