datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
dots-ocr-britanica
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/ency-test using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/ency-test
Model: rednote-hilab/dots.ocr
Number of Samples: 512
Processing Time: 10.3 min
Processing Date: 2025-10-09 07:52 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 512
Prompt Mode: layout-only
Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-britanica.dots-ocr-test-loc_beyond_words
Document OCR using dots.ocr
This dataset contains OCR results from images in biglam/loc_beyond_words using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: biglam/loc_beyond_words
Model: rednote-hilab/dots.ocr
Number of Samples: 128
Processing Time: 4.8 min
Processing Date: 2025-10-07 14:45 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 128
Prompt Mode: ocr
Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-loc_beyond_words.encyclopaedia_britannica_illustrated-dots-ocr
Document OCR using dots.ocr
This dataset contains OCR results from images in NationalLibraryOfScotland/encyclopaedia_britannica_illustrated using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: NationalLibraryOfScotland/encyclopaedia_britannica_illustrated
Model: rednote-hilab/dots.ocr
Number of Samples: 100
Processing Time: 5.4 min
Processing Date: 2025-10-22 14:28 UTC
Configuration
Image Column: image
Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia_britannica_illustrated-dots-ocr.dots-ocr-test-bpl-index-cards
Document OCR using dots.ocr
This dataset contains OCR results from images in biglam/bpl-card-catalog using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: biglam/bpl-card-catalog
Model: rednote-hilab/dots.ocr
Number of Samples: 256
Processing Time: 2.3 min
Processing Date: 2025-10-07 14:32 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 128
Prompt Mode: layout-all
Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-bpl-index-cards.dots-ocr-bpl-card-catalog
Document OCR using dots.ocr
This dataset contains OCR results from images in biglam/bpl-card-catalog using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: biglam/bpl-card-catalog
Model: rednote-hilab/dots.ocr
Number of Samples: 5,000
Processing Time: 32.7 min
Processing Date: 2025-10-07 15:21 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 128
Prompt Mode: layout-all
Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-bpl-card-catalog.dots-ocr-test
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: rednote-hilab/dots.ocr
Number of Samples: 1,000
Processing Time: 10.7 min
Processing Date: 2025-10-07 15:19 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 256
Prompt Mode: ocr
Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test.handbooks-dots-ocr
Document OCR using dots.ocr
This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset
Model: rednote-hilab/dots.ocr
Number of Samples: 100
Processing Time: 3.2 min
Processing Date: 2025-10-22 14:39 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/handbooks-dots-ocr.slates-dots-ocr
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/transcribed-slates using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/transcribed-slates
Model: rednote-hilab/dots.ocr
Number of Samples: 100
Processing Time: 1.5 min
Processing Date: 2025-10-22 15:19 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 256
Prompt Mode: ocr
Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/slates-dots-ocr.dots-ocr-test-exams
Document OCR using dots.ocr
This dataset contains OCR results from images in NationalLibraryOfScotland/Scottish-School-Exam-Papers using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: NationalLibraryOfScotland/Scottish-School-Exam-Papers
Model: rednote-hilab/dots.ocr
Number of Samples: 10
Processing Time: 1.6 min
Processing Date: 2025-10-07 14:23 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-exams.ocr-smoke-dots-v1-fix
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: rednote-hilab/dots.ocr
Number of Samples: 3
Processing Time: 1.9 min
Processing Date: 2026-02-16 16:38 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: ocr
Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-smoke-dots-v1-fix.dotsocr-extractionsdots-ocr-playbills
Document OCR using dots.ocr
This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset
Model: rednote-hilab/dots.ocr
Number of Samples: 10
Processing Time: 2.2 min
Processing Date: 2025-10-08 16:53 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-playbills.dotsocr-markdown-dataset
dotsocr_markdown_dataset
Dataset Description
This dataset contains training data for DotsOCR to convert document images directly to markdown format.
Training Objective
The model learns to:
Convert document images to clean markdown format
Preserve document structure and hierarchy
Extract all text content accurately
Use appropriate markdown formatting for different content types
Dataset Structure
Training samples: 798
Validation samples: 200
Total… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr-markdown-dataset.dots-ocr-handbooks
Document OCR using dots.ocr
This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset
Model: rednote-hilab/dots.ocr
Number of Samples: 2,000
Processing Time: 12.5 min
Processing Date: 2025-10-09 13:45 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-handbooks.dots-ocr-arxiv-author-affiliation-predictions-Qwen3-8B-distil-claude_sonnet_4Predictions from our LoRA adapter for Qwen/Qwen3-8B on a collection of ArXiv papers converted to markdown using dots.ocr.
ocr-output_dots_layout_all
Document OCR using dots.ocr
This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: rednote-hilab/dots.ocr
Number of Samples: 13
Processing Time: 1.8 min
Processing Date: 2026-02-09 04:37 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: layout-all
Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_all.ocr-output_dots
Document OCR using dots.ocr
This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: rednote-hilab/dots.ocr
Number of Samples: 13
Processing Time: 1.7 min
Processing Date: 2026-02-07 15:52 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: ocr
Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots.dots-ocr-1.5-nls-layout-test
Document OCR using dots.ocr-1.5
This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing.
Processing Details
Source Dataset: davanstrien/nls-highland-news-sample
Model: davanstrien/dots.ocr-1.5
Number of Samples: 10
Processing Time: 6.4 min
Processing Date: 2026-03-14 17:30 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-nls-layout-test.dots_ocr_dataocr-output_dots_ocr
Document OCR using dots.ocr
This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: rednote-hilab/dots.ocr
Number of Samples: 13
Processing Time: 1.8 min
Processing Date: 2026-02-09 04:34 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: ocr
Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_ocr.dotsocr-extractions-holdoutocr-output_dots_layout_only
Document OCR using dots.ocr
This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: rednote-hilab/dots.ocr
Number of Samples: 13
Processing Time: 1.8 min
Processing Date: 2026-02-09 04:40 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: layout-only
Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_only.dots-ocr-1.5-smoke-test-v3
Document OCR using dots.ocr-1.5
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: davanstrien/dots.ocr-1.5
Number of Samples: 3
Processing Time: 2.0 min
Processing Date: 2026-03-14 16:38 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test-v3.ocr-affordances-dots
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/ocr-affordances-pages
Model: rednote-hilab/dots.ocr
Number of Samples: 8
Processing Time: 3.1 min
Processing Date: 2026-06-05 14:15 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-dots.dots-ocr-debug-test
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: rednote-hilab/dots.ocr
Number of Samples: 20
Processing Time: 2.8 min
Processing Date: 2026-02-25 13:36 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: ocr
Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-debug-test.dots-ocr-1.5-smoke-test
Document OCR using dots.ocr-1.5
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: davanstrien/dots.ocr-1.5
Number of Samples: 3
Processing Time: 1.9 min
Processing Date: 2026-03-14 16:10 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test.sample-dots-ocr
Document OCR using dots.ocr
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: rednote-hilab/dots.ocr
Number of Samples: 2
Processing Time: 2.4 min
Processing Date: 2026-06-05 10:32 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode: ocr
Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/sample-dots-ocr.dotsocr_bank_statement_1K_v2
dotsocr_bank_statement_1K
Dataset Description
This dataset contains OCR and layout analysis training data formatted according to DotsOCR specifications by rednote-hilab.
DotsOCR Format Features
Proper Reading Order: Layout elements are sorted according to natural reading order (top to bottom, left to right)
Validated Categories: All categories conform to DotsOCR's specification: ['Caption', 'Footnote', 'Formula', 'List-item', 'Page-footer', 'Page-header'… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr_bank_statement_1K_v2.dots-ocr-1.5-layout-test
Document OCR using dots.ocr-1.5
This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: davanstrien/dots.ocr-1.5
Number of Samples: 3
Processing Time: 7.7 min
Processing Date: 2026-03-14 17:05 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-layout-test.dotsocr_bank_statement_half
dotsocr_bank_statement_half
Dataset Description
This dataset contains OCR and layout analysis training data formatted according to DotsOCR specifications by rednote-hilab.
DotsOCR Format Features
Proper Reading Order: Layout elements are sorted according to natural reading order (top to bottom, left to right)
Validated Categories: All categories conform to DotsOCR's specification: ['Caption', 'Footnote', 'Formula', 'List-item', 'Page-footer', 'Page-header'… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr_bank_statement_half.
