CoolFace
Datasetpublic

jwidmer/test-powerserver-preprocessing

Dataset Card for test-powerserver-preprocessing This dataset was created using pagexml-hf converter from Transkribus PageXML data. Dataset Summary This dataset contains 61 samples across 1 split(s). Dataset Structure Data Splits train: 61 samples Dataset Size Approximate total size: 509.28 MB Total samples: 61 Features image: Image(mode=None, decode=False) xml_content: Value('string') filename:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes15downloads
Dataset Card

Dataset Card for test-powerserver-preprocessing

This dataset was created using pagexml-hf converter from Transkribus PageXML data.

Dataset Summary

This dataset contains 61 samples across 1 split(s).

Dataset Structure

Data Splits

  • train: 61 samples

Dataset Size

  • Approximate total size: 509.28 MB
  • Total samples: 61

Features

  • image: Image(mode=None, decode=False)
  • xml_content: Value('string')
  • filename: Value('string')
  • project_name: Value('string')

Data Organization

Data is organized as parquet shards by split and project:

data/
├── <split>/
│   └── <project_name>/
│       └── <timestamp>-<shard>.parquet

The HuggingFace Hub automatically merges all parquet files when loading the dataset.

Usage

python
from datasets import load_dataset

# Load entire dataset
dataset = load_dataset("jwidmer/test-powerserver-preprocessing")

# Load specific split
train_dataset = load_dataset("jwidmer/test-powerserver-preprocessing", split="train")

Projects Included

1507-05-13Hanserezess,LübeckAscensioDomini1507(SAHSTRep2,I_040-6)