CoolFace
Datasetpublic

jwidmer/trocr-hanse-test-inference

Dataset Card for trocr-hanse-test-inference This dataset is derived from jwidmer/trocr-hanse-test-inference and has been enriched with inference results. Dataset Summary This dataset contains 164 samples across 1 split(s). Projects Included 1505-02-10_Hanserezess,Lübeck_Dienstag_nach_Scholastice_1505(SAHST_Rep__2,_I_040-4) Evaluation Results This repository includes evaluation artifacts for the latest inference output. Timestamp:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/trocr-hanse-test-inference.

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes11downloads
Dataset Card

Dataset Card for trocr-hanse-test-inference

This dataset is derived from jwidmer/trocr-hanse-test-inference and has been enriched with inference results.

Dataset Summary

This dataset contains 164 samples across 1 split(s).

Projects Included

1505-02-10Hanserezess,LübeckDienstagnachScholastice1505(SAHSTRep_2,I_040-4)

Evaluation Results

This repository includes evaluation artifacts for the latest inference output.

  • —Timestamp: 2026-08-06T08:17:36
  • —CER: 0.10577399227493314
  • —Evaluated rows: 164
  • —Evaluated split: train
  • —Inference column: inference_20260806_081552_705482_model_fgho_trocr-hanseXVI-kurrent

Evaluation Files

text
evaluation/2026-08-06T08_17_36/
├── gt.txt
├── hypothesis.txt
└── evaluation_report.json

Dataset Structure

Data Splits

  • —train: 164 samples

Dataset Size

  • —Approximate total size: 32.52 MB
  • —Total samples: 164

Features

  • —project_name: Value('large_string')
  • —filename: Value('large_string')
  • —region_id: Value('large_string')
  • —line_id: Value('large_string')
  • —line_augmentation: Value('large_string')
  • —image: Image(mode=None, decode=False)
  • —text: Value('large_string')
  • —line_reading_order: Value('int64')
  • —line_coords: List(List(Value('int64')))
  • —line_baseline: List(List(Value('int64')))
  • —region_reading_order: Value('int64')
  • —region_type: Value('large_string')
  • —region_coords: List(List(Value('int64')))
  • —inference_20260609_091737_453856_model_fgho_trocr-hanseXVI-kurrent: Value('large_string')
  • —inference_20260806_081552_705482_model_fgho_trocr-hanseXVI-kurrent: Value('string')

Data Organization

Data is organized as parquet shards by split and project:

data/
├── <split>/
│   └── <project_name>/
│       └── <timestamp>-<shard>.parquet

The HuggingFace Hub automatically merges all parquet files when loading the dataset.

Usage

python
from datasets import load_dataset

# Load entire dataset
dataset = load_dataset("jwidmer/trocr-hanse-test-inference")

# Load specific split
dataset_split = load_dataset("jwidmer/trocr-hanse-test-inference", split="train")