datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
fleet-test-falcon-ocr
Document Processing using Falcon OCR (plain mode)
This dataset contains OCR results from images in davanstrien/ufo-ColPali using Falcon OCR, a 0.3B early-fusion vision-language model.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: tiiuae/Falcon-OCR
Task Mode: plain - Full-page text extraction
Number of Samples: 2
Processing Time: 1.2 min
Processing Date: 2026-06-05 09:47 UTC
Backend: falcon-perception (OCRInferenceEngine)… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/fleet-test-falcon-ocr.fleet-test-paddleocr-vl-1.6
Document Processing using PaddleOCR-VL-1.6 (OCR mode)
This dataset contains OCR results from images in davanstrien/ufo-ColPali using PaddleOCR-VL-1.6, an ultra-compact 0.9B OCR model (96.33% SOTA on OmniDocBench v1.6).
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: PaddlePaddle/PaddleOCR-VL-1.6
Task Mode: ocr - General text extraction to markdown format
Number of Samples: 2
Processing Time: 1.9 min
Processing Date: 2026-06-05 09:51 UTC… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/fleet-test-paddleocr-vl-1.6.
