jwidmer/trocr-hanse-test-inference
Dataset Card for trocr-hanse-test-inference This dataset is derived from jwidmer/trocr-hanse-test-inference and has been enriched with inference results. Dataset Summary This dataset contains 164 samples across 1 split(s). Projects Included 1505-02-10_Hanserezess,Lübeck_Dienstag_nach_Scholastice_1505(SAHST_Rep__2,_I_040-4) Evaluation Results This repository includes evaluation artifacts for the latest inference output. Timestamp:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/trocr-hanse-test-inference.
Dataset Card for trocr-hanse-test-inference
This dataset is derived from jwidmer/trocr-hanse-test-inference and has been enriched with inference results.
Dataset Summary
This dataset contains 164 samples across 1 split(s).
Projects Included
1505-02-10Hanserezess,LübeckDienstagnachScholastice1505(SAHSTRep_2,I_040-4)
Evaluation Results
This repository includes evaluation artifacts for the latest inference output.
- Timestamp: 2026-08-06T08:17:36
- CER: 0.10577399227493314
- Evaluated rows: 164
- Evaluated split: train
- Inference column:
inference_20260806_081552_705482_model_fgho_trocr-hanseXVI-kurrent
Evaluation Files
evaluation/2026-08-06T08_17_36/
├── gt.txt
├── hypothesis.txt
└── evaluation_report.jsonDataset Structure
Data Splits
- train: 164 samples
Dataset Size
- Approximate total size: 32.52 MB
- Total samples: 164
Features
- project_name:
Value('large_string') - filename:
Value('large_string') - region_id:
Value('large_string') - line_id:
Value('large_string') - line_augmentation:
Value('large_string') - image:
Image(mode=None, decode=False) - text:
Value('large_string') - line_reading_order:
Value('int64') - line_coords:
List(List(Value('int64'))) - line_baseline:
List(List(Value('int64'))) - region_reading_order:
Value('int64') - region_type:
Value('large_string') - region_coords:
List(List(Value('int64'))) - inference_20260609_091737_453856_model_fgho_trocr-hanseXVI-kurrent:
Value('large_string') - inference_20260806_081552_705482_model_fgho_trocr-hanseXVI-kurrent:
Value('string')
Data Organization
Data is organized as parquet shards by split and project:
data/
├── <split>/
│ └── <project_name>/
│ └── <timestamp>-<shard>.parquetThe HuggingFace Hub automatically merges all parquet files when loading the dataset.
Usage
from datasets import load_dataset
# Load entire dataset
dataset = load_dataset("jwidmer/trocr-hanse-test-inference")
# Load specific split
dataset_split = load_dataset("jwidmer/trocr-hanse-test-inference", split="train")