CoolFace
24 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01davanstrien /encyclopaedia_britannica_illustrated-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/encyclopaedia_britannica_illustrated using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/encyclopaedia_britannica_illustrated Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 5.4 min Processing Date: 2025-10-22 14:28 UTC Configuration Image Column: image Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia_britannica_illustrated-dots-ocr.imagen<1K0 likes35 downloads11mo agoHugging Face02davanstrien /dots-ocr-britanica Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ency-test using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ency-test Model: rednote-hilab/dots.ocr Number of Samples: 512 Processing Time: 10.3 min Processing Date: 2025-10-09 07:52 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 512 Prompt Mode: layout-only Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-britanica.imagen<1K0 likes34 downloads1y agoHugging Face03davanstrien /dots-ocr-bpl-card-catalog Document OCR using dots.ocr This dataset contains OCR results from images in biglam/bpl-card-catalog using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: biglam/bpl-card-catalog Model: rednote-hilab/dots.ocr Number of Samples: 5,000 Processing Time: 32.7 min Processing Date: 2025-10-07 15:21 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 128 Prompt Mode: layout-all Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-bpl-card-catalog.image1K<n<10K2 likes32 downloads1y agoHugging Face04davanstrien /handbooks-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 3.2 min Processing Date: 2025-10-22 14:39 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/handbooks-dots-ocr.imagen<1K0 likes27 downloads11mo agoHugging Face05davanstrien /slates-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/transcribed-slates using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/transcribed-slates Model: rednote-hilab/dots.ocr Number of Samples: 100 Processing Time: 1.5 min Processing Date: 2025-10-22 15:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 256 Prompt Mode: ocr Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/slates-dots-ocr.imagen<1K0 likes23 downloads11mo agoHugging Face06davanstrien /ocr-smoke-dots-v1-fix Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 3 Processing Time: 1.9 min Processing Date: 2026-02-16 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-smoke-dots-v1-fix.imagen<1K0 likes23 downloads7mo agoHugging Face07davanstrien /dots-ocr-test Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 1,000 Processing Time: 10.7 min Processing Date: 2025-10-07 15:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 256 Prompt Mode: ocr Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test.image1K<n<10K0 likes22 downloads1y agoHugging Face08davanstrien /dots-ocr-test-exams Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Scottish-School-Exam-Papers using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Scottish-School-Exam-Papers Model: rednote-hilab/dots.ocr Number of Samples: 10 Processing Time: 1.6 min Processing Date: 2025-10-07 14:23 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-test-exams.imagen<1K0 likes22 downloads7mo agoHugging Face09davanstrien /dots-ocr-handbooks Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 2,000 Processing Time: 12.5 min Processing Date: 2025-10-09 13:45 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-handbooks.image1K<n<10K1 likes17 downloads1y agoHugging Face10davanstrien /dots-ocr-playbills Document OCR using dots.ocr This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: rednote-hilab/dots.ocr Number of Samples: 10 Processing Time: 2.2 min Processing Date: 2025-10-08 16:53 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-playbills.imagen<1K0 likes16 downloads1y agoHugging Face11cometadata /dots-ocr-arxiv-author-affiliation-predictions-Qwen3-8B-distil-claude_sonnet_4Predictions from our LoRA adapter for Qwen/Qwen3-8B on a collection of ArXiv papers converted to markdown using dots.ocr. text1K<n<10K0 likes16 downloads1y agoHugging Face12minhpvo /ocr-output_dots Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.7 min Processing Date: 2026-02-07 15:52 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots.imagen<1K0 likes14 downloads8mo agoHugging Face13davanstrien /dots-ocr-1.5-nls-layout-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/nls-highland-news-sample Model: davanstrien/dots.ocr-1.5 Number of Samples: 10 Processing Time: 6.4 min Processing Date: 2026-03-14 17:30 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-nls-layout-test.imagen<1K0 likes14 downloads7mo agoHugging Face14minhpvo /ocr-output_dots_layout_all Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:37 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: layout-all Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_all.imagen<1K0 likes13 downloads8mo agoHugging Face15minhpvo /ocr-output_dots_ocr Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:34 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8,192 tokens… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_ocr.imagen<1K0 likes13 downloads8mo agoHugging Face16minhpvo /ocr-output_dots_layout_only Document OCR using dots.ocr This dataset contains OCR results from images in minhpvo/ocr-input using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: minhpvo/ocr-input Model: rednote-hilab/dots.ocr Number of Samples: 13 Processing Time: 1.8 min Processing Date: 2026-02-09 04:40 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: layout-only Max Model Length: 8,192… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_dots_layout_only.imagen<1K0 likes11 downloads8mo agoHugging Face17davanstrien /dots-ocr-1.5-smoke-test-v3 Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 2.0 min Processing Date: 2026-03-14 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test-v3.imagen<1K0 likes11 downloads7mo agoHugging Face18davanstrien /sample-dots-ocr Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 2 Processing Time: 2.4 min Processing Date: 2026-06-05 10:32 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/sample-dots-ocr.imagen<1K0 likes9 downloads4mo agoHugging Face19davanstrien /ocr-affordances-dots Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ocr-affordances-pages Model: rednote-hilab/dots.ocr Number of Samples: 8 Processing Time: 3.1 min Processing Date: 2026-06-05 14:15 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-dots.imagen<1K0 likes9 downloads4mo agoHugging Face20davanstrien /dots-ocr-debug-test Document OCR using dots.ocr This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr, a compact 1.7B multilingual model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: rednote-hilab/dots.ocr Number of Samples: 20 Processing Time: 2.8 min Processing Date: 2026-02-25 13:36 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode: ocr Max Model Length: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-debug-test.imagen<1K0 likes8 downloads7mo agoHugging Face21davanstrien /dots-ocr-1.5-smoke-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 1.9 min Processing Date: 2026-03-14 16:10 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test.imagen<1K0 likes8 downloads7mo agoHugging Face22davanstrien /dots-ocr-1.5-layout-test Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 7.7 min Processing Date: 2026-03-14 17:05 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Prompt Mode:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-layout-test.imagen<1K0 likes5 downloads7mo agoHugging Face23v1v1d /vivid_dataset_with_dotsocrimagen<1K0 likes3 downloads11mo agoHugging Face24Minhvt /out-dots-ocrdocumentn<1K0 likes2 downloads7mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.