document-parsing
multimodal-vision-ocr-document-parsing-2026
📐 Multimodal Vision-Language & Industrial OCR Document Parsing SFT/DPO Suite (2026)
This repository provides the official 100-sample production teaser of the Multimodal Vision-Language & Industrial OCR Document Parsing SFT/DPO Suite (2026) by BeatsProm AI Research Lab.
The dataset is engineered to train open-weights Vision-Language Models (Qwen2-VL, Pixtral-12B, Llama-3.2-Vision, ColPali) on dense document parsing, normalized spatial bounding boxes (<box>[ymin, xmin, ymax… See the full description on the dataset page: https://huggingface.co/datasets/beatsprom/multimodal-vision-ocr-document-parsing-2026.repro-ovisocr-end-to-end-document-parsing-traces
Agent traces
Agent sessions published from a Trackio Logbook.
SROIE-document-parsingDonut_documentparsing_synHMP
