ingala09/Hanserezesse_2half_16th_50s_linesfromxml
Dataset Card for Hanserezesse_2half_16th_50s_linesfromxml This dataset was created using pagexml-hf converter from Transkribus PageXML data. Dataset Summary This dataset contains 3,560 samples across 1 split(s). Dataset Structure Data Splits train: 3,560 samples Dataset Size Approximate total size: 907.57 MB Total samples: 3,560 Features image: Image(mode=None, decode=False) text: Value('string')… See the full description on the dataset page: https://huggingface.co/datasets/ingala09/Hanserezesse_2half_16th_50s_linesfromxml.
Dataset Card for Hanserezesse2half16th50slinesfromxml
This dataset was created using pagexml-hf converter from Transkribus PageXML data.
Dataset Summary
This dataset contains 3,560 samples across 1 split(s).
Dataset Structure
Data Splits
- train: 3,560 samples
Dataset Size
- Approximate total size: 907.57 MB
- Total samples: 3,560
Features
- image:
Image(mode=None, decode=False) - text:
Value('string') - line_id:
Value('string') - line_reading_order:
Value('int64') - line_coords:
List(List(Value('int64'))) - line_baseline:
List(List(Value('int64'))) - line_augmentation:
Value('string') - region_id:
Value('string') - region_reading_order:
Value('int64') - region_type:
Value('string') - region_coords:
List(List(Value('int64'))) - filename:
Value('string') - project_name:
Value('string')
Data Organization
Data is organized as parquet shards by split and project:
data/
├── <split>/
│ └── <project_name>/
│ └── <timestamp>-<shard>.parquetThe HuggingFace Hub automatically merges all parquet files when loading the dataset.
Usage
from datasets import load_dataset
# Load entire dataset
dataset = load_dataset("ingala09/Hanserezesse_2half_16th_50s_linesfromxml")
# Load specific split
train_dataset = load_dataset("ingala09/Hanserezesse_2half_16th_50s_linesfromxml", split="train")Projects Included
1553-05-08RecessuscivitatumAnzeTheutonice(HAStK-RBABest_82A20), 1556-11-18RecessusLubecaefactusAnno1556(Indeks)(APG300,28_26)
