unlimited-ocr
dogovors-unlimited-ocr
Dogovors Unlimited-OCR Dataset
OCR/document-layout dataset prepared for fine-tuning baidu/Unlimited-OCR.
Files
train.jsonl contains one JSON object per document.
images/ contains the page images referenced by relative path.
JSONL Schema
{
"images": [
"images/doc_001_page_001.jpg",
"images/doc_001_page_002.jpg"
],
"question": "Multi page parsing.",
"answer": "<PAGE><|det|>title [400, 60, 660, 73]<|/det|>...
<PAGE><|det|>text [100… See the full description on the dataset page: https://huggingface.co/datasets/p4ulbr4dl3y/dogovors-unlimited-ocr.unlimited-ocr-multipage-smoke
Document OCR using Unlimited-OCR
This dataset contains OCR results for davanstrien/unlimited-ocr-pdf-test
produced by baidu/Unlimited-OCR with vLLM.
Processing Details
Source Dataset: davanstrien/unlimited-ocr-pdf-test
Model: baidu/Unlimited-OCR
Mode: multi-page (one document per row)
Number of Samples: 2
Processing Time: 2.3 min
Processing Date: 2026-06-28 09:20 UTC
Output Column: markdown
Max Pages/Document: 20
Split: train
Output
The column… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/unlimited-ocr-multipage-smoke.unlimited-ocr-britannica-smoke
Document OCR using Unlimited-OCR
This dataset contains OCR results for davanstrien/encyclopaedia-britannica-1771
produced by baidu/Unlimited-OCR with vLLM.
Processing Details
Source Dataset: davanstrien/encyclopaedia-britannica-1771
Model: baidu/Unlimited-OCR
Mode: single image per row
Number of Samples: 8
Processing Time: 3.0 min
Processing Date: 2026-06-28 09:17 UTC
Output Column: markdown
Split: train
Output
Grounding markup was stripped… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/unlimited-ocr-britannica-smoke.unlimited-ocr-archive-testunlimited-ocr-smoke-v2
Document OCR using Unlimited-OCR
This dataset contains OCR results for davanstrien/unlimited-ocr-smoke-v2
produced by baidu/Unlimited-OCR with vLLM.
Processing Details
Source Dataset: davanstrien/unlimited-ocr-smoke-v2
Model: baidu/Unlimited-OCR
Number of Samples: 5
Processing Time: 2.2 min
Processing Date: 2026-06-30 13:49 UTC
Output Column: markdown
Split: train
Output
The column holds the model's raw layout-grounded markdown: text spans tagged… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/unlimited-ocr-smoke-v2.unlimited-ocr-pdf-test
