jwidmer/test-powerserver-preprocessing
Dataset Card for test-powerserver-preprocessing This dataset was created using pagexml-hf converter from Transkribus PageXML data. Dataset Summary This dataset contains 61 samples across 1 split(s). Dataset Structure Data Splits train: 61 samples Dataset Size Approximate total size: 509.28 MB Total samples: 61 Features image: Image(mode=None, decode=False) xml_content: Value('string') filename:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing.
Dataset Card for test-powerserver-preprocessing
This dataset was created using pagexml-hf converter from Transkribus PageXML data.
Dataset Summary
This dataset contains 61 samples across 1 split(s).
Dataset Structure
Data Splits
- train: 61 samples
Dataset Size
- Approximate total size: 509.28 MB
- Total samples: 61
Features
- image:
Image(mode=None, decode=False) - xml_content:
Value('string') - filename:
Value('string') - project_name:
Value('string')
Data Organization
Data is organized as parquet shards by split and project:
data/
├── <split>/
│ └── <project_name>/
│ └── <timestamp>-<shard>.parquetThe HuggingFace Hub automatically merges all parquet files when loading the dataset.
Usage
from datasets import load_dataset
# Load entire dataset
dataset = load_dataset("jwidmer/test-powerserver-preprocessing")
# Load specific split
train_dataset = load_dataset("jwidmer/test-powerserver-preprocessing", split="train")Projects Included
1507-05-13Hanserezess,LübeckAscensioDomini1507(SAHSTRep2,I_040-6)
