davanstrien/falcon-ocr-v2-test-100
Document Processing using Falcon OCR (plain mode) This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: tiiuae/Falcon-OCR Task Mode: plain - Full-page text extraction Number of Samples: 100 Processing Time: 5.3 min Processing Date: 2026-04-07 20:41 UTC Backend: falcon-perception (OCRInferenceEngine)… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/falcon-ocr-v2-test-100.
Document Processing using Falcon OCR (plain mode)
This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model.
Processing Details
- Source Dataset: davanstrien/ufo-ColPali
- Model: tiiuae/Falcon-OCR
- Task Mode:
plain- Full-page text extraction - Number of Samples: 100
- Processing Time: 5.3 min
- Processing Date: 2026-04-07 20:41 UTC
- Backend: falcon-perception (OCRInferenceEngine)
Reproduction
uv run https://huggingface.co/datasets/uv-scripts/ocr/raw/main/falcon-ocr-v2.py \
davanstrien/ufo-ColPali \
<output-dataset> \
--task-mode plain \
--image-column imageGenerated with UV Scripts
