uv-scripts/ocr
OCR UV Scripts Part of uv-scripts — self-contained UV scripts you run on Hugging Face Jobs in one command. A model zoo of OCR scripts — one per model — that add a markdown column to an image dataset. Pick a model from the table below, point it at your dataset, and run it on a GPU with one command. A few recipes do structured extraction instead — image or text → JSON given a schema (see Structured extraction below). Two more companions sit alongside: pp-doclayout.py detects… See the full description on the dataset page: https://huggingface.co/datasets/uv-scripts/ocr.
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Sync from GitHub via hub-sync
Add PaddleOCR-VL-1.6 script (vLLM, image-mode)
nuextract3: add --instructions for chat_template_kwargs.instructions
Add NuExtract3: markdown OCR + structured JSON extraction (#11)
dots-mocr: skip whole batch when an image fails to decode
smoldocling-ocr: skip whole batch when an image fails to decode
pp-doclayout: skip corrupt images instead of crashing the run
falcon-ocr-bucket: add --max-samples with early-termination scan
Add pp-doclayout.py to README (layout detection, separate from OCR)
Add pp-doclayout.py: PP-DocLayout-L layout detection with bucket support
Add AGENTS.md for coding agent discovery
Update Falcon OCR README description (remove layout claim)
Simplify falcon-ocr.py to plain mode only, add --progress flag
Fix volume mount syntax in falcon-ocr-bucket.py examples
