datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
summarize_from_feedback_oai_preprocessing_1711138793
Dataset Card for "summarize_from_feedback_oai_preprocessing_1711138793"
More Information needed
summarize_from_feedback_oai_preprocessing_1711138084
Dataset Card for "summarize_from_feedback_oai_preprocessing_1711138084"
More Information needed
test-powerserver-preprocessing-writeback
Dataset Card for test-powerserver-preprocessing-writeback
This dataset is derived from jwidmer/test-powerserver-preprocessing and enriched with raw XML inference derived from jwidmer/test-bie-preprocessing-lines.
Dataset Summary
This dataset contains 61 samples across 1 split(s).
Projects Included
1507-05-13_Hanserezess,Lübeck_Ascensio_Domini_1507(SAHST_Rep__2,_I_040-6)
Dataset Structure
Data Splits
train: 61 samples… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing-writeback.test-bie-preprocessing-lines
Dataset Card for test-bie-preprocessing-lines
This dataset is derived from jwidmer/test-bie-preprocessing-lines and has been enriched with inference results.
Dataset Summary
This dataset contains 825 samples across 1 split(s).
Projects Included
1507-05-13_Hanserezess,Lübeck_Ascensio_Domini_1507(SAHST_Rep__2,_I_040-6)
Duplicate Line Information
Duplicate line statistics are calculated from the dataset key columns filename, region_id… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-bie-preprocessing-lines.test-powerserver-preprocessing-lines
Dataset Card for test-powerserver-preprocessing-lines
This dataset was created using pagexml-hf converter from Transkribus PageXML data.
Dataset Summary
This dataset contains 825 samples across 1 split(s).
Dataset Structure
Data Splits
train: 825 samples
Dataset Size
Approximate total size: 118.71 MB
Total samples: 825
Features
image: Image(mode=None, decode=False)
text: Value('string')
line_id:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing-lines.test-powerserver-preprocessing
Dataset Card for test-powerserver-preprocessing
This dataset was created using pagexml-hf converter from Transkribus PageXML data.
Dataset Summary
This dataset contains 61 samples across 1 split(s).
Dataset Structure
Data Splits
train: 61 samples
Dataset Size
Approximate total size: 509.28 MB
Total samples: 61
Features
image: Image(mode=None, decode=False)
xml_content: Value('string')
filename:… See the full description on the dataset page: https://huggingface.co/datasets/jwidmer/test-powerserver-preprocessing.Preprocessing-khalidchawtany-ckb_simple_ocr_dataset
CKB Simple OCR Dataset (Processed)
Dataset Description
This dataset contains 15,000 Central Kurdish (Sorani) OCR samples from the khalidchawtany/ckb_simple_ocr_dataset, preprocessed using the asosoft library for Kurdish text normalization.
Languages
Central Kurdish (ckb) / Sorani Kurdish
Dataset Structure
The dataset maintains the same structure as the original CKB Simple OCR dataset with the following columns:
image
text
Data Processing… See the full description on the dataset page: https://huggingface.co/datasets/shiima/Preprocessing-khalidchawtany-ckb_simple_ocr_dataset.
