CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01davanstrien /dots-ocr-britanica Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ency-test using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ency-test Model: rednote-hilab/dots.ocr Number of Samples: 512 Processing Time: 10.3 min Processing Date: 2025-10-09 07:52 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 512 Prompt Mode: layout-only Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-britanica.imagen<1K0 likes36 downloads1y agoHugging Face02davanstrien /dots-ocr-test-loc_beyond_words Document OCR using dots.ocr This dataset contains OCR results from images in biglam/loc_beyond_words using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: biglam/loc_beyond_words Model: rednote-hilab/dots.ocr Number of Samples: 128 Processing Time: 4.8 min Processing Date: 2025-10-07 14:45 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 128 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-loc_beyond_words.0 likes35 downloads1y agoHugging Face03davanstrien /encyclopaedia_britannica_illustrated-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/encyclopaedia_britannica_illustrated using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/encyclopaedia_britannica_illustrated Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 5.4 min Processing Date: 2025-10-22 14:28 UTC Configuration Image Column: image Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia_britannica_illustrated-dots-ocr.imagen<1K0 likes33 downloads11mo agoHugging Face04davanstrien /dots-ocr-test-bpl-index-cards Document OCR using dots.ocr This dataset contains OCR results from images in biglam/bpl-card-catalog using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: biglam/bpl-card-catalog Model: rednote-hilab/dots.ocr Number of Samples: 256 Processing Time: 2.3 min Processing Date: 2025-10-07 14:32 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 128 Prompt Mode: layout-all Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-bpl-index-cards.0 likes30 downloads1y agoHugging Face05davanstrien /dots-ocr-bpl-card-catalog Document OCR using dots.ocr This dataset contains OCR results from images in biglam/bpl-card-catalog using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: biglam/bpl-card-catalog Model: rednote-hilab/dots.ocr Number of Samples: 5,000 Processing Time: 32.7 min Processing Date: 2025-10-07 15:21 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 128 Prompt Mode: layout-all Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-bpl-card-catalog.image1K<n<10K2 likes30 downloads1y agoHugging Face06davanstrien /dots-ocr-test Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 1,000 Processing Time: 10.7 min Processing Date: 2025-10-07 15:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 256 Prompt Mode: ocr Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test.image1K<n<10K0 likes28 downloads1y agoHugging Face07davanstrien /handbooks-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 3.2 min Processing Date: 2025-10-22 14:39 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/handbooks-dots-ocr.imagen<1K0 likes26 downloads11mo agoHugging Face08davanstrien /slates-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/transcribed-slates using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/transcribed-slates Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 1.5 min Processing Date: 2025-10-22 15:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 256 Prompt Mode: ocr Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/slates-dots-ocr.imagen<1K0 likes25 downloads11mo agoHugging Face09davanstrien /dots-ocr-test-exams Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Scottish-School-Exam-Papers using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Scottish-School-Exam-Papers Model: rednote-hilab/dots.ocr Number of Samples: 10 Processing Time: 1.6 min Processing Date: 2025-10-07 14:23 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-exams.imagen<1K0 likes24 downloads7mo agoHugging Face10davanstrien /ocr-smoke-dots-v1-fix Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 3 Processing Time: 1.9 min Processing Date: 2026-02-16 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-smoke-dots-v1-fix.imagen<1K0 likes24 downloads7mo agoHugging Face11bluecopa /dotsocr-extractionstabular1K<n<10K0 likes19 downloads9mo agoHugging Face12davanstrien /dots-ocr-playbills Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 10 Processing Time: 2.2 min Processing Date: 2025-10-08 16:53 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-playbills.imagen<1K0 likes18 downloads1y agoHugging Face13rita1706 /dotsocr-markdown-dataset dotsocr_markdown_dataset Dataset Description This dataset contains training data for DotsOCR to convert document images directly to markdown format. Training Objective The model learns to: Convert document images to clean markdown format Preserve document structure and hierarchy Extract all text content accurately Use appropriate markdown formatting for different content types Dataset Structure Training samples: 798 Validation samples: 200 Total… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr-markdown-dataset.imagen<1K0 likes17 downloads1y agoHugging Face14davanstrien /dots-ocr-handbooks Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 2,000 Processing Time: 12.5 min Processing Date: 2025-10-09 13:45 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-handbooks.image1K<n<10K1 likes17 downloads1y agoHugging Face15cometadata /dots-ocr-arxiv-author-affiliation-predictions-Qwen3-8B-distil-claude_sonnet_4Predictions from our LoRA adapter for Qwen/Qwen3-8B on a collection of ArXiv papers converted to markdown using dots.ocr. text1K<n<10K0 likes16 downloads11mo agoHugging Face16minhpvo /ocr-output_dots_layout_all Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:37 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: layout-all Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_all.imagen<1K0 likes15 downloads8mo agoHugging Face17minhpvo /ocr-output_dots Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.7 min Processing Date: 2026-02-07 15:52 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots.imagen<1K0 likes14 downloads8mo agoHugging Face18davanstrien /dots-ocr-1.5-nls-layout-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/nls-highland-news-sample Model: davanstrien/dots.ocr-1.5 Number of Samples: 10 Processing Time: 6.4 min Processing Date: 2026-03-14 17:30 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-nls-layout-test.imagen<1K0 likes14 downloads6mo agoHugging Face19arnabkar101 /dots_ocr_dataimage1K<n<10K0 likes13 downloads1y agoHugging Face20minhpvo /ocr-output_dots_ocr Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:34 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_ocr.imagen<1K0 likes13 downloads8mo agoHugging Face21bluecopa /dotsocr-extractions-holdouttabularn<1K0 likes12 downloads9mo agoHugging Face22minhpvo /ocr-output_dots_layout_only Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:40 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: layout-only Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_only.imagen<1K0 likes12 downloads8mo agoHugging Face23davanstrien /dots-ocr-1.5-smoke-test-v3 Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 2.0 min Processing Date: 2026-03-14 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test-v3.imagen<1K0 likes10 downloads6mo agoHugging Face24davanstrien /ocr-affordances-dots Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ocr-affordances-pages Model: rednote-hilab/dots.ocr Number of Samples: 8 Processing Time: 3.1 min Processing Date: 2026-06-05 14:15 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-dots.imagen<1K0 likes10 downloads4mo agoHugging Face25davanstrien /dots-ocr-debug-test Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 20 Processing Time: 2.8 min Processing Date: 2026-02-25 13:36 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-debug-test.imagen<1K0 likes8 downloads7mo agoHugging Face26davanstrien /dots-ocr-1.5-smoke-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 1.9 min Processing Date: 2026-03-14 16:10 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test.imagen<1K0 likes8 downloads6mo agoHugging Face27davanstrien /sample-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 2 Processing Time: 2.4 min Processing Date: 2026-06-05 10:32 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/sample-dots-ocr.imagen<1K0 likes8 downloads4mo agoHugging Face28rita1706 /dotsocr_bank_statement_1K_v2 dotsocr_bank_statement_1K Dataset Description This dataset contains OCR and layout analysis training data formatted according to DotsOCR specifications by rednote-hilab. DotsOCR Format Features Proper Reading Order: Layout elements are sorted according to natural reading order (top to bottom, left to right) Validated Categories: All categories conform to DotsOCR's specification: ['Caption', 'Footnote', 'Formula', 'List-item', 'Page-footer', 'Page-header'… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr_bank_statement_1K_v2.image1K<n<10K0 likes7 downloads1y agoHugging Face29davanstrien /dots-ocr-1.5-layout-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 7.7 min Processing Date: 2026-03-14 17:05 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-layout-test.imagen<1K0 likes7 downloads6mo agoHugging Face30rita1706 /dotsocr_bank_statement_half dotsocr_bank_statement_half Dataset Description This dataset contains OCR and layout analysis training data formatted according to DotsOCR specifications by rednote-hilab. DotsOCR Format Features Proper Reading Order: Layout elements are sorted according to natural reading order (top to bottom, left to right) Validated Categories: All categories conform to DotsOCR's specification: ['Caption', 'Footnote', 'Formula', 'List-item', 'Page-footer', 'Page-header'… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr_bank_statement_half.imagen<1K0 likes4 downloads1y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.