storytracer/bhl-240p-60v-optimized
bhl-240p-60v-optimized OCR-model comparison published with ocrscout. Each row pairs one source page with one model's normalized output. Summary Pages: 224 Models: 3 Rows: 718 Pages with errors: 0 Mean disagreement: 0.163 Median disagreement: 0.092 Source images embedded: yes Generated: 2026-06-27 10:27 UTC by ocrscout v0.1.0 Per-model metrics Model Format Pages OK Pages errored Total tokens Mean tokens/pg Mean s/pg Mean prepare s Mean chars… See the full description on the dataset page: https://huggingface.co/datasets/storytracer/bhl-240p-60v-optimized.
bhl-240p-60v-optimized
OCR-model comparison published with ocrscout. Each row pairs one source page with one model's normalized output.
Summary
- Pages: 224
- Models: 3
- Rows: 718
- Pages with errors: 0
- Mean disagreement: 0.163
- Median disagreement: 0.092
- Source images embedded: yes
- Generated: 2026-06-27 10:27 UTC by ocrscout v0.1.0
Per-model metrics
Top-disagreement pages
Pairwise word-diff distance averaged across all models on the page. 0 = perfect agreement; 1 = no shared tokens.
Schema
Each row in data/train-*.parquet is one (page, model) pair.
Use this dataset
Load with `datasets`:
from datasets import load_dataset
ds = load_dataset("storytracer/bhl-240p-60v-optimized", split="train")
print(ds[0]["file_id"], ds[0]["model"])Browse with the ocrscout viewer:
pip install 'ocrscout[viewer] @ git+https://github.com/storytracer/ocrscout.git'
python -c "from huggingface_hub import snapshot_download; print(snapshot_download('storytracer/bhl-240p-60v-optimized', repo_type='dataset', local_dir='./scout-snap'))"
ocrscout viewer ./scout-snapPipeline configuration
The full ocrscout pipeline that produced this dataset:
name: run
source:
name: bhl
args:
pages_per_volume: 4
sample: 240
seed: 24
reference: null
comparisons: null
models:
- lighton-ocr2
- glm-ocr-layout
- dots-mocr
normalizer_overrides: {}
export:
name: parquet
args:
dest: data/output/bhl-240p-60v-optimized/data/train-00000-of-00001.parquet
reporter: null
sample: 240
output_dir: data/output/bhl-240p-60v-optimized