CoolFace
Datasetpublic

davanstrien/falcon-ocr-v2-test-100

Document Processing using Falcon OCR (plain mode) This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: tiiuae/Falcon-OCR Task Mode: plain - Full-page text extraction Number of Samples: 100 Processing Time: 5.3 min Processing Date: 2026-04-07 20:41 UTC Backend: falcon-perception (OCRInferenceEngine)… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/falcon-ocr-v2-test-100.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes13downloads
Dataset Card

Document Processing using Falcon OCR (plain mode)

This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model.

Processing Details

  • Source Dataset: davanstrien/ufo-ColPali
  • Model: tiiuae/Falcon-OCR
  • Task Mode: plain - Full-page text extraction
  • Number of Samples: 100
  • Processing Time: 5.3 min
  • Processing Date: 2026-04-07 20:41 UTC
  • Backend: falcon-perception (OCRInferenceEngine)

Reproduction

bash
uv run https://huggingface.co/datasets/uv-scripts/ocr/raw/main/falcon-ocr-v2.py \
    davanstrien/ufo-ColPali \
    <output-dataset> \
    --task-mode plain \
    --image-column image

Generated with UV Scripts