CoolFace
20 results

unlimited-ocr

p4ulbr4dl3y /dogovors-unlimited-ocr Dogovors Unlimited-OCR Dataset OCR/document-layout dataset prepared for fine-tuning baidu/Unlimited-OCR. Files train.jsonl contains one JSON object per document. images/ contains the page images referenced by relative path. JSONL Schema { "images": [ "images/doc_001_page_001.jpg", "images/doc_001_page_002.jpg" ], "question": "Multi page parsing.", "answer": "<PAGE><|det|>title [400, 60, 660, 73]<|/det|>... <PAGE><|det|>text [100… See the full description on the dataset page: https://huggingface.co/datasets/p4ulbr4dl3y/dogovors-unlimited-ocr.imagen<1K0 likes22 downloads3mo agoHugging Facedavanstrien /unlimited-ocr-multipage-smoke Document OCR using Unlimited-OCR This dataset contains OCR results for davanstrien/unlimited-ocr-pdf-test produced by baidu/Unlimited-OCR with vLLM. Processing Details Source Dataset: davanstrien/unlimited-ocr-pdf-test Model: baidu/Unlimited-OCR Mode: multi-page (one document per row) Number of Samples: 2 Processing Time: 2.3 min Processing Date: 2026-06-28 09:20 UTC Output Column: markdown Max Pages/Document: 20 Split: train Output The column… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/unlimited-ocr-multipage-smoke.textn<1K0 likes20 downloads3mo agoHugging Facedavanstrien /unlimited-ocr-britannica-smoke Document OCR using Unlimited-OCR This dataset contains OCR results for davanstrien/encyclopaedia-britannica-1771 produced by baidu/Unlimited-OCR with vLLM. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: baidu/Unlimited-OCR Mode: single image per row Number of Samples: 8 Processing Time: 3.0 min Processing Date: 2026-06-28 09:17 UTC Output Column: markdown Split: train Output Grounding markup was stripped… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/unlimited-ocr-britannica-smoke.imagen<1K0 likes16 downloads3mo agoHugging FaceTim-Pinecone /unlimited-ocr-archive-test0 likes13 downloads3mo agoHugging Facedavanstrien /unlimited-ocr-smoke-v2 Document OCR using Unlimited-OCR This dataset contains OCR results for davanstrien/unlimited-ocr-smoke-v2 produced by baidu/Unlimited-OCR with vLLM. Processing Details Source Dataset: davanstrien/unlimited-ocr-smoke-v2 Model: baidu/Unlimited-OCR Number of Samples: 5 Processing Time: 2.2 min Processing Date: 2026-06-30 13:49 UTC Output Column: markdown Split: train Output The column holds the model's raw layout-grounded markdown: text spans tagged… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/unlimited-ocr-smoke-v2.imagen<1K0 likes10 downloads3mo agoHugging Facedavanstrien /unlimited-ocr-pdf-testtextn<1K0 likes9 downloads3mo agoHugging Face