CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01omarelsherif010 /glm-ocr-bnk-finetuning GLM-OCR Fine-Tuning Pipeline Fine-tuning GLM-OCR 0.9B (CogViT encoder + GLM-0.5B decoder) for Korean financial document table recognition using LoRA via LLaMA-Factory. Performance Targets Metric Target TEDS (2-level nested) >= 90% TEDS (3-level nested) >= 85% Korean CER <= 1% Latency <= 0.5s/page Directory Structure glm_ocr_finetuning/ ├── config/ # Training/eval YAML configs │ ├── training_config.yaml #… See the full description on the dataset page: https://huggingface.co/datasets/omarelsherif010/glm-ocr-bnk-finetuning.0 likes668 downloads7mo agoHugging Face02p4ulbr4dl3y /glm-ocr-ru-dataset GLM-OCR Russian Dataset (Interfax) This dataset was generated programmatically for fine-tuning Vision-Language models, specifically GLM-OCR or Qwen-VL / Qwen2-VL, on Russian document OCR. Dataset Details Source: News texts from the Russian news agency "Interfax". Size: 4,998 samples (multi-paragraph image-text pairs). Format: ShareGPT VLM format (compatible with LLaMA-Factory out-of-the-box). Image format: WebP (quality 85) for minimal disk space footprint (~150… See the full description on the dataset page: https://huggingface.co/datasets/p4ulbr4dl3y/glm-ocr-ru-dataset.image1K<n<10K0 likes364 downloads3mo agoHugging Face03davanstrien /bpl-card-catalog-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/bpl-card-catalog-with-ocr Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 453,006 Processing Time: 1315.3 min Processing Date: 2026-02-27 11:43 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr.image100K<n<1M0 likes97 downloads7mo agoHugging Face04davanstrien /enc-brit-glm-ocr-v2-full Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 2,724 Processing Time: 376.7 min Processing Date: 2026-02-18 20:29 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-full.image1K<n<10K4 likes60 downloads7mo agoHugging Face05andesco /risk-financing-4th-glm-ocrimagen<1K0 likes29 downloads7mo agoHugging Face06mehdigououiad /permis-ocr-glm Document OCR using GLM-OCR This dataset contains OCR results from images in mehdigououiad/permis-ocr-bench using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: mehdigououiad/permis-ocr-bench Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 2 Processing Time: 1.3 min Processing Date: 2026-08-11 13:48 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/mehdigououiad/permis-ocr-glm.imagen<1K0 likes27 downloads1mo agoHugging Face07davanstrien /rubenstein-manuscript-catalog-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in biglam/rubenstein-manuscript-catalog using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: biglam/rubenstein-manuscript-catalog Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 49,654 Processing Time: 343.2 min Processing Date: 2026-02-14 15:38 UTC Configuration Image Column: image Output Column: markdown Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/rubenstein-manuscript-catalog-glm-ocr.image10K<n<100K0 likes20 downloads7mo agoHugging Face08davanstrien /nls-highland-news-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/nls-highland-news-sample Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 68 Processing Time: 23.0 min Processing Date: 2026-02-20 17:32 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-highland-news-glm-ocr.imagen<1K0 likes20 downloads7mo agoHugging Face09andesco /risk-assessment-treatment-glm-ocrimagen<1K0 likes18 downloads7mo agoHugging Face10davanstrien /enc-brit-glm-ocr-v2-test Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 50 Processing Time: 9.5 min Processing Date: 2026-02-18 10:40 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-test.imagen<1K0 likes15 downloads7mo agoHugging Face11stephenmcconnachie /0004-glm-ocr-table Document OCR using GLM-OCR This dataset contains OCR results from images in stephenmcconnachie/0004-pdf-pages-test using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: stephenmcconnachie/0004-pdf-pages-test Model: zai-org/GLM-OCR Task: table recognition Number of Samples: 50 Processing Time: 3.4 min Processing Date: 2026-06-21 10:12 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/stephenmcconnachie/0004-glm-ocr-table.imagen<1K0 likes15 downloads3mo agoHugging Face12andesco /risk-management-3rd-glm-ocrimagen<1K0 likes14 downloads7mo agoHugging Face13yhan86 /uillinois1952image-glmocr Document OCR using GLM-OCR This dataset contains OCR results from images in yhan86/uillinois1952image using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: yhan86/uillinois1952image Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 14 Processing Time: 2.0 min Processing Date: 2026-04-02 18:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16… See the full description on the dataset page: https://huggingface.co/datasets/yhan86/uillinois1952image-glmocr.imagen<1K0 likes14 downloads6mo agoHugging Face14minhpvo /ocr-output_glm Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 13 Processing Time: 2.2 min Processing Date: 2026-02-07 15:51 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm.imagen<1K0 likes13 downloads8mo agoHugging Face15minhpvo /ocr-output_glm_formula Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: formula recognition Number of Samples: 13 Processing Time: 2.3 min Processing Date: 2026-02-09 04:16 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_formula.imagen<1K0 likes13 downloads8mo agoHugging Face16minhpvo /ocr-output_glm_ocr Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 13 Processing Time: 2.2 min Processing Date: 2026-02-09 04:12 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_ocr.imagen<1K0 likes12 downloads8mo agoHugging Face17davanstrien /bpl-card-catalog-glm-ocr-bench Document OCR using DeepSeek-OCR-2 This dataset contains markdown-formatted OCR results from images in davanstrien/bpl-card-catalog-glm-ocr-bench using DeepSeek-OCR-2. Processing Details Source Dataset: davanstrien/bpl-card-catalog-glm-ocr-bench Model: deepseek-ai/DeepSeek-OCR-2 Number of Samples: 500 Processing Time: 7.0 min Processing Date: 2026-02-14 17:26 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench.imagen<1K0 likes12 downloads7mo agoHugging Face18davanstrien /bpl-card-catalog-glm-ocr-bench-l4 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/bpl-card-catalog-with-ocr Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 500 Processing Time: 2.1 min Processing Date: 2026-02-13 13:03 UTC Configuration Image Column: image Output Column: markdown Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench-l4.imagen<1K0 likes12 downloads7mo agoHugging Face19davanstrien /nls-highland-news-segments-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/nls-highland-news-segments-fullres using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/nls-highland-news-segments-fullres Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 1,178 Processing Time: 3.9 min Processing Date: 2026-02-23 16:40 UTC Configuration Image Column: image Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-highland-news-segments-glm-ocr.image1K<n<10K1 likes12 downloads7mo agoHugging Face20davanstrien /glm-ocr-test-v2 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 2.1 min Processing Date: 2026-02-05 14:24 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v2.imagen<1K0 likes11 downloads8mo agoHugging Face21davanstrien /glm-ocr-test-v1 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 2.1 min Processing Date: 2026-02-05 14:00 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v1.imagen<1K0 likes10 downloads8mo agoHugging Face22minhpvo /ocr-output_glm_table Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: table recognition Number of Samples: 13 Processing Time: 2.3 min Processing Date: 2026-02-09 04:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_table.imagen<1K0 likes10 downloads8mo agoHugging Face23davanstrien /bpl-card-catalog-glm-ocr-bench-l40s Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/bpl-card-catalog-with-ocr Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 500 Processing Time: 2.8 min Processing Date: 2026-02-13 13:04 UTC Configuration Image Column: image Output Column: markdown Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench-l40s.imagen<1K0 likes10 downloads7mo agoHugging Face24davanstrien /glm-ocr-test-v3 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 2.1 min Processing Date: 2026-02-05 14:35 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v3.imagen<1K0 likes9 downloads8mo agoHugging Face25haguirre-rfnr /sroie-glm-ocr-chatimage10K<n<100K0 likes9 downloads7mo agoHugging Face26davanstrien /nls-medical-glm-ocr-test Document OCR using GLM-OCR This dataset contains OCR results from images in NationalLibraryOfScotland/medical-history-of-british-india using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: NationalLibraryOfScotland/medical-history-of-british-india Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 7.1 min Processing Date: 2026-02-12 14:22 UTC Configuration Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-medical-glm-ocr-test.imagen<1K0 likes8 downloads7mo agoHugging Face27andesco /risk-management-3rd-glm-ocr-testimagen<1K0 likes8 downloads7mo agoHugging Face28davanstrien /ocr-affordances-glm Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ocr-affordances-pages Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 8 Processing Time: 2.9 min Processing Date: 2026-06-05 14:15 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-glm.imagen<1K1 likes7 downloads4mo agoHugging Face29davanstrien /encyclopaedia-britannica-1771-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 100 Processing Time: 9.0 min Processing Date: 2026-02-17 16:03 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia-britannica-1771-glm-ocr.imagen<1K0 likes6 downloads7mo agoHugging Face30davanstrien /glm-ocr-test-v4 Document OCR using GLM-OCR This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 4.1 min Processing Date: 2026-02-05 14:42 UTC Configuration Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v4.imagen<1K0 likes5 downloads8mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.