datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
pp-ocr-mnn-eval
PP-OCR MNN evaluation dataset (811-cell matrix)
Images (273) + canonical paddle.inference baselines (808 json) + configs
for scoring pp-ocr-mnn outputs. See README.md and
https://github.com/baicai1145/pp-ocr-mnn (tools/score.py).
A single-file snapshot is also included as ppocr-eval-dataset.tar.zst.
PPOCRLLMPP-OCRv5_ONNXONNX-converted models from PaddlePaddle/PaddleOCR.
Models
Model
Purpose
PP-OCRv5_mobile_det.onnx
Text detection
PP-OCRv5_mobile_rec.onnx
Text recognition
PP-LCNet_x1_0_table_cls.onnx
Table classification
UVDoc.onnx
Document image correction
SLANeXt_wired.onnx
Table structure recognition (wired)
SLANeXt_wireless.onnx
Table structure recognition (wireless)
Source
Converted from PaddlePaddle format using Paddle2ONNX.
License… See the full description on the dataset page: https://huggingface.co/datasets/BMekiker/PP-OCRv5_ONNX.permis-ocr-ppocrv6
OCR with PP-OCRv6 Medium
Plain-text OCR results for images from mehdigououiad/permis-ocr-bench, produced by
PaddlePaddle's PP-OCRv6
medium pipeline (34.5M (22M det + 19M rec)).
Processing details
Source: mehdigououiad/permis-ocr-bench
Model: PP-OCRv6_medium (PP-OCRv6_medium_det + PP-OCRv6_medium_rec)
Tier: medium (34.5M (22M det + 19M rec))
Recognition accuracy: 83.2%
Languages: 50 languages (zh, zh-Hant, en, ja + 46 Latin-script)
Engine: paddle_static
Samples: 2… See the full description on the dataset page: https://huggingface.co/datasets/mehdigououiad/permis-ocr-ppocrv6.pp-ocrv6-smoke-v4
OCR with PP-OCRv6 TINY
Plain-text OCR results for images from davanstrien/ufo-ColPali, produced by
PaddlePaddle's PP-OCRv6
tiny pipeline (1.5M (0.4M det + 1.1M rec)).
Processing details
Source: davanstrien/ufo-ColPali
Model: PP-OCRv6_tiny (PP-OCRv6_tiny_det + PP-OCRv6_tiny_rec)
Tier: tiny (1.5M (0.4M det + 1.1M rec))
Recognition accuracy: 73.5%
Languages: 49 languages (en, zh only — no ja)
Engine: paddle_static
Samples: 3
Processing time: 0.41 min
Processing… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/pp-ocrv6-smoke-v4.webtoon_ppocrv5_detPPOCR-weightsppocrlabelflux_one_word_ppocr_filtered
