CoolFace
Datasetpublic

davanstrien/falcon-ocr-test-20

Document Processing using Falcon OCR (plain mode) This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: tiiuae/Falcon-OCR Task Mode: plain - Full-page text extraction Number of Samples: 20 Processing Time: 10.8 min Processing Date: 2026-04-07 20:17 UTC Configuration Image Column: image Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/falcon-ocr-test-20.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes7downloads
Dataset Card

Document Processing using Falcon OCR (plain mode)

This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model.

Processing Details

  • Source Dataset: davanstrien/ufo-ColPali
  • Model: tiiuae/Falcon-OCR
  • Task Mode: plain - Full-page text extraction
  • Number of Samples: 20
  • Processing Time: 10.8 min
  • Processing Date: 2026-04-07 20:17 UTC

Configuration

  • Image Column: image
  • Dataset Split: train
  • Max Output Tokens: 2,048
  • Backend: Transformers

Model Information

Falcon OCR is a compact early-fusion model that processes image patches and text tokens in a shared Transformer. Key results:

  • 80.3% on olmOCR benchmark
  • 88.64% on OmniDocBench
  • 87.1% on multi-column documents (best in class)
  • 90.3% on tables (best in class)

Reproduction

bash
uv run https://huggingface.co/datasets/uv-scripts/ocr/raw/main/falcon-ocr.py \
    davanstrien/ufo-ColPali \
    <output-dataset> \
    --task-mode plain \
    --image-column image

Generated with UV Scripts