CoolFace
Datasetpublic

davanstrien/dots-ocr-1.5-smoke-test-v3

Document OCR using dots.ocr-1.5 This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: davanstrien/dots.ocr-1.5 Number of Samples: 3 Processing Time: 2.0 min Processing Date: 2026-03-14 16:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/dots-ocr-1.5-smoke-test-v3.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes10downloads
Dataset Card

Document OCR using dots.ocr-1.5

This dataset contains OCR results from images in davanstrien/ufo-ColPali using DoTS.ocr-1.5, a 3B multilingual model with SOTA document parsing.

Processing Details

Configuration

  • Image Column: image
  • Output Column: markdown
  • Dataset Split: train
  • Batch Size: 16
  • Prompt Mode: ocr
  • Max Model Length: 24,000 tokens
  • Max Output Tokens: 24,000
  • GPU Memory Utilization: 90.0%

Model Information

DoTS.ocr-1.5 is a 3B multilingual document parsing model that excels at:

  • 100+ Languages — Multilingual document support
  • Table extraction — Structured data recognition
  • Formulas — Mathematical notation preservation
  • Layout-aware — Reading order and structure preservation
  • Web screen parsing — Webpage layout analysis
  • Scene text spotting — Text detection in natural scenes

Dataset Structure

The dataset contains all original columns plus:

  • markdown: The extracted text in markdown format
  • inference_info: JSON list tracking all OCR models applied to this dataset

Usage

python
from datasets import load_dataset
import json

# Load the dataset
dataset = load_dataset("{output_dataset_id}", split="train")

# Access the markdown text
for example in dataset:
    print(example["markdown"])
    break

# View all OCR models applied to this dataset
inference_info = json.loads(dataset[0]["inference_info"])
for info in inference_info:
    print(f"Column: {info['column_name']} - Model: {info['model_id']}")

Reproduction

This dataset was generated using the uv-scripts/ocr DoTS OCR 1.5 script:

bash
uv run https://huggingface.co/datasets/uv-scripts/ocr/raw/main/dots-ocr-1.5.py \
    davanstrien/ufo-ColPali \
    <output-dataset> \
    --image-column image \
    --batch-size 16 \
    --prompt-mode ocr \
    --max-model-len 24000 \
    --max-tokens 24000 \
    --gpu-memory-utilization 0.9

Generated with UV Scripts