datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
glm-ocr-bnk-finetuning
GLM-OCR Fine-Tuning Pipeline
Fine-tuning GLM-OCR 0.9B (CogViT encoder + GLM-0.5B decoder) for Korean financial document table recognition using LoRA via LLaMA-Factory.
Performance Targets
Metric
Target
TEDS (2-level nested)
>= 90%
TEDS (3-level nested)
>= 85%
Korean CER
<= 1%
Latency
<= 0.5s/page
Directory Structure
glm_ocr_finetuning/
├── config/ # Training/eval YAML configs
│ ├── training_config.yaml #… See the full description on the dataset page: https://huggingface.co/datasets/omarelsherif010/glm-ocr-bnk-finetuning.glm-ocr-ru-dataset
GLM-OCR Russian Dataset (Interfax)
This dataset was generated programmatically for fine-tuning Vision-Language models, specifically GLM-OCR or Qwen-VL / Qwen2-VL, on Russian document OCR.
Dataset Details
Source: News texts from the Russian news agency "Interfax".
Size: 4,998 samples (multi-paragraph image-text pairs).
Format: ShareGPT VLM format (compatible with LLaMA-Factory out-of-the-box).
Image format: WebP (quality 85) for minimal disk space footprint (~150… See the full description on the dataset page: https://huggingface.co/datasets/p4ulbr4dl3y/glm-ocr-ru-dataset.bpl-card-catalog-glm-ocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/bpl-card-catalog-with-ocr
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 453,006
Processing Time: 1315.3 min
Processing Date: 2026-02-27 11:43 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr.enc-brit-glm-ocr-v2-full
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/encyclopaedia-britannica-1771
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 2,724
Processing Time: 376.7 min
Processing Date: 2026-02-18 20:29 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-full.risk-financing-4th-glm-ocrpermis-ocr-glm
Document OCR using GLM-OCR
This dataset contains OCR results from images in mehdigououiad/permis-ocr-bench using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: mehdigououiad/permis-ocr-bench
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 2
Processing Time: 1.3 min
Processing Date: 2026-08-11 13:48 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/mehdigououiad/permis-ocr-glm.rubenstein-manuscript-catalog-glm-ocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in biglam/rubenstein-manuscript-catalog using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: biglam/rubenstein-manuscript-catalog
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 49,654
Processing Time: 343.2 min
Processing Date: 2026-02-14 15:38 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/rubenstein-manuscript-catalog-glm-ocr.nls-highland-news-glm-ocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/nls-highland-news-sample
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 68
Processing Time: 23.0 min
Processing Date: 2026-02-20 17:32 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-highland-news-glm-ocr.risk-assessment-treatment-glm-ocrenc-brit-glm-ocr-v2-test
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/encyclopaedia-britannica-1771
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 50
Processing Time: 9.5 min
Processing Date: 2026-02-18 10:40 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-test.0004-glm-ocr-table
Document OCR using GLM-OCR
This dataset contains OCR results from images in stephenmcconnachie/0004-pdf-pages-test using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: stephenmcconnachie/0004-pdf-pages-test
Model: zai-org/GLM-OCR
Task: table recognition
Number of Samples: 50
Processing Time: 3.4 min
Processing Date: 2026-06-21 10:12 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/stephenmcconnachie/0004-glm-ocr-table.risk-management-3rd-glm-ocruillinois1952image-glmocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in yhan86/uillinois1952image using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: yhan86/uillinois1952image
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 14
Processing Time: 2.0 min
Processing Date: 2026-04-02 18:38 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16… See the full description on the dataset page: https://huggingface.co/datasets/yhan86/uillinois1952image-glmocr.ocr-output_glm
Document OCR using GLM-OCR
This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 13
Processing Time: 2.2 min
Processing Date: 2026-02-07 15:51 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm.ocr-output_glm_formula
Document OCR using GLM-OCR
This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: zai-org/GLM-OCR
Task: formula recognition
Number of Samples: 13
Processing Time: 2.3 min
Processing Date: 2026-02-09 04:16 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max Model… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_formula.ocr-output_glm_ocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 13
Processing Time: 2.2 min
Processing Date: 2026-02-09 04:12 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_ocr.bpl-card-catalog-glm-ocr-bench
Document OCR using DeepSeek-OCR-2
This dataset contains markdown-formatted OCR results from images in davanstrien/bpl-card-catalog-glm-ocr-bench using DeepSeek-OCR-2.
Processing Details
Source Dataset: davanstrien/bpl-card-catalog-glm-ocr-bench
Model: deepseek-ai/DeepSeek-OCR-2
Number of Samples: 500
Processing Time: 7.0 min
Processing Date: 2026-02-14 17:26 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench.bpl-card-catalog-glm-ocr-bench-l4
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/bpl-card-catalog-with-ocr
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 500
Processing Time: 2.1 min
Processing Date: 2026-02-13 13:03 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench-l4.nls-highland-news-segments-glm-ocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/nls-highland-news-segments-fullres using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/nls-highland-news-segments-fullres
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 1,178
Processing Time: 3.9 min
Processing Date: 2026-02-23 16:40 UTC
Configuration
Image Column: image
Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-highland-news-segments-glm-ocr.glm-ocr-test-v2
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 10
Processing Time: 2.1 min
Processing Date: 2026-02-05 14:24 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v2.glm-ocr-test-v1
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 10
Processing Time: 2.1 min
Processing Date: 2026-02-05 14:00 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v1.ocr-output_glm_table
Document OCR using GLM-OCR
This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: minhpvo/ocr-input
Model: zai-org/GLM-OCR
Task: table recognition
Number of Samples: 13
Processing Time: 2.3 min
Processing Date: 2026-02-09 04:19 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_table.bpl-card-catalog-glm-ocr-bench-l40s
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/bpl-card-catalog-with-ocr
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 500
Processing Time: 2.8 min
Processing Date: 2026-02-13 13:04 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench-l40s.glm-ocr-test-v3
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/ufo-ColPali
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 10
Processing Time: 2.1 min
Processing Date: 2026-02-05 14:35 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split: train
Batch Size: 16
Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v3.sroie-glm-ocr-chatnls-medical-glm-ocr-test
Document OCR using GLM-OCR
This dataset contains OCR results from images in NationalLibraryOfScotland/medical-history-of-british-india using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: NationalLibraryOfScotland/medical-history-of-british-india
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 10
Processing Time: 7.1 min
Processing Date: 2026-02-12 14:22 UTC
Configuration
Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-medical-glm-ocr-test.risk-management-3rd-glm-ocr-testocr-affordances-glm
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/ocr-affordances-pages
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 8
Processing Time: 2.9 min
Processing Date: 2026-06-05 14:15 UTC
Configuration
Image Column: image
Output Column: markdown
Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-glm.encyclopaedia-britannica-1771-glm-ocr
Document OCR using GLM-OCR
This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: davanstrien/encyclopaedia-britannica-1771
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 100
Processing Time: 9.0 min
Processing Date: 2026-02-17 16:03 UTC
Configuration
Image Column: image
Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia-britannica-1771-glm-ocr.glm-ocr-test-v4
Document OCR using GLM-OCR
This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance.
Processing Details
Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset
Model: zai-org/GLM-OCR
Task: text recognition
Number of Samples: 10
Processing Time: 4.1 min
Processing Date: 2026-02-05 14:42 UTC
Configuration
Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v4.
