CoolFace
26 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01davanstrien /encyclopaedia_britannica_illustrated-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/encyclopaedia_britannica_illustrated using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/encyclopaedia_britannica_illustrated Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 5.4 min Processing Date: 2025-10-22 14:28 UTC Configuration Image Column: image Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia_britannica_illustrated-dots-ocr.imagen<1K0 likes35 downloads11mo agoHugging Face02davanstrien /dots-ocr-britanica Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ency-test using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ency-test Model: rednote-hilab/dots.ocr Number of Samples: 512 Processing Time: 10.3 min Processing Date: 2025-10-09 07:52 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 512 Prompt Mode: layout-only Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-britanica.imagen<1K0 likes34 downloads1y agoHugging Face03davanstrien /dots-ocr-bpl-card-catalog Document OCR using dots.ocr This dataset contains OCR results from images in biglam/bpl-card-catalog using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: biglam/bpl-card-catalog Model: rednote-hilab/dots.ocr Number of Samples: 5,000 Processing Time: 32.7 min Processing Date: 2025-10-07 15:21 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 128 Prompt Mode: layout-all Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-bpl-card-catalog.image1K<n<10K2 likes32 downloads1y agoHugging Face04davanstrien /handbooks-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 3.2 min Processing Date: 2025-10-22 14:39 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/handbooks-dots-ocr.imagen<1K0 likes27 downloads11mo agoHugging Face05davanstrien /slates-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/transcribed-slates using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/transcribed-slates Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 1.5 min Processing Date: 2025-10-22 15:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 256 Prompt Mode: ocr Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/slates-dots-ocr.imagen<1K0 likes23 downloads11mo agoHugging Face06davanstrien /ocr-smoke-dots-v1-fix Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 3 Processing Time: 1.9 min Processing Date: 2026-02-16 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-smoke-dots-v1-fix.imagen<1K0 likes23 downloads7mo agoHugging Face07davanstrien /dots-ocr-test Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 1,000 Processing Time: 10.7 min Processing Date: 2025-10-07 15:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 256 Prompt Mode: ocr Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test.image1K<n<10K0 likes22 downloads1y agoHugging Face08davanstrien /dots-ocr-test-exams Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Scottish-School-Exam-Papers using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Scottish-School-Exam-Papers Model: rednote-hilab/dots.ocr Number of Samples: 10 Processing Time: 1.6 min Processing Date: 2025-10-07 14:23 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-exams.imagen<1K0 likes22 downloads7mo agoHugging Face09arnabkar101 /dots_ocr_dataimage1K<n<10K0 likes20 downloads1y agoHugging Face10rita1706 /dotsocr-markdown-dataset dotsocr_markdown_dataset Dataset Description This dataset contains training data for DotsOCR to convert document images directly to markdown format. Training Objective The model learns to: Convert document images to clean markdown format Preserve document structure and hierarchy Extract all text content accurately Use appropriate markdown formatting for different content types Dataset Structure Training samples: 798 Validation samples: 200 Total… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr-markdown-dataset.imagen<1K0 likes17 downloads1y agoHugging Face11davanstrien /dots-ocr-handbooks Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 2,000 Processing Time: 12.5 min Processing Date: 2025-10-09 13:45 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-handbooks.image1K<n<10K1 likes17 downloads1y agoHugging Face12davanstrien /dots-ocr-playbills Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 10 Processing Time: 2.2 min Processing Date: 2025-10-08 16:53 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-playbills.imagen<1K0 likes16 downloads1y agoHugging Face13minhpvo /ocr-output_dots Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.7 min Processing Date: 2026-02-07 15:52 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots.imagen<1K0 likes14 downloads8mo agoHugging Face14davanstrien /dots-ocr-1.5-nls-layout-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/nls-highland-news-sample Model: davanstrien/dots.ocr-1.5 Number of Samples: 10 Processing Time: 6.4 min Processing Date: 2026-03-14 17:30 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-nls-layout-test.imagen<1K0 likes14 downloads7mo agoHugging Face15minhpvo /ocr-output_dots_layout_all Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:37 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: layout-all Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_all.imagen<1K0 likes13 downloads8mo agoHugging Face16minhpvo /ocr-output_dots_ocr Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:34 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_ocr.imagen<1K0 likes13 downloads8mo agoHugging Face17minhpvo /ocr-output_dots_layout_only Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:40 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: layout-only Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_only.imagen<1K0 likes11 downloads8mo agoHugging Face18davanstrien /dots-ocr-1.5-smoke-test-v3 Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 2.0 min Processing Date: 2026-03-14 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test-v3.imagen<1K0 likes11 downloads7mo agoHugging Face19davanstrien /sample-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 2 Processing Time: 2.4 min Processing Date: 2026-06-05 10:32 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/sample-dots-ocr.imagen<1K0 likes9 downloads4mo agoHugging Face20davanstrien /ocr-affordances-dots Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ocr-affordances-pages Model: rednote-hilab/dots.ocr Number of Samples: 8 Processing Time: 3.1 min Processing Date: 2026-06-05 14:15 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-dots.imagen<1K0 likes9 downloads4mo agoHugging Face21rita1706 /dotsocr_bank_statement_1K_v2 dotsocr_bank_statement_1K Dataset Description This dataset contains OCR and layout analysis training data formatted according to DotsOCR specifications by rednote-hilab. DotsOCR Format Features Proper Reading Order: Layout elements are sorted according to natural reading order (top to bottom, left to right) Validated Categories: All categories conform to DotsOCR's specification: ['Caption', 'Footnote', 'Formula', 'List-item', 'Page-footer', 'Page-header'… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr_bank_statement_1K_v2.image1K<n<10K0 likes8 downloads1y agoHugging Face22davanstrien /dots-ocr-debug-test Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 20 Processing Time: 2.8 min Processing Date: 2026-02-25 13:36 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-debug-test.imagen<1K0 likes8 downloads7mo agoHugging Face23davanstrien /dots-ocr-1.5-smoke-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 1.9 min Processing Date: 2026-03-14 16:10 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test.imagen<1K0 likes8 downloads7mo agoHugging Face24rita1706 /dotsocr_bank_statement_half dotsocr_bank_statement_half Dataset Description This dataset contains OCR and layout analysis training data formatted according to DotsOCR specifications by rednote-hilab. DotsOCR Format Features Proper Reading Order: Layout elements are sorted according to natural reading order (top to bottom, left to right) Validated Categories: All categories conform to DotsOCR's specification: ['Caption', 'Footnote', 'Formula', 'List-item', 'Page-footer', 'Page-header'… See the full description on the dataset page: https://huggingface.co/datasets/rita1706/dotsocr_bank_statement_half.imagen<1K0 likes5 downloads1y agoHugging Face25davanstrien /dots-ocr-1.5-layout-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 7.7 min Processing Date: 2026-03-14 17:05 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-layout-test.imagen<1K0 likes5 downloads7mo agoHugging Face26v1v1d /vivid_dataset_with_dotsocrimagen<1K0 likes3 downloads11mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.