CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01p4ulbr4dl3y /glm-ocr-ru-dataset GLM-OCR Russian Dataset (Interfax) This dataset was generated programmatically for fine-tuning Vision-Language models, specifically GLM-OCR or Qwen-VL / Qwen2-VL, on Russian document OCR. Dataset Details Source: News texts from the Russian news agency "Interfax". Size: 4,998 samples (multi-paragraph image-text pairs). Format: ShareGPT VLM format (compatible with LLaMA-Factory out-of-the-box). Image format: WebP (quality 85) for minimal disk space footprint (~150… See the full description on the dataset page: https://huggingface.co/datasets/p4ulbr4dl3y/glm-ocr-ru-dataset.image1K<n<10K0 likes358 downloads3mo agoHugging Face02davanstrien /bpl-card-catalog-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/bpl-card-catalog-with-ocr Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 453,006 Processing Time: 1315.3 min Processing Date: 2026-02-27 11:43 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr.image100K<n<1M0 likes94 downloads7mo agoHugging Face03davanstrien /enc-brit-glm-ocr-v2-full Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 2,724 Processing Time: 376.7 min Processing Date: 2026-02-18 20:29 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-full.image1K<n<10K4 likes53 downloads7mo agoHugging Face04andesco /risk-financing-4th-glm-ocrimagen<1K0 likes29 downloads7mo agoHugging Face05mehdigououiad /permis-ocr-glm Document OCR using GLM-OCR This dataset contains OCR results from images in mehdigououiad/permis-ocr-bench using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: mehdigououiad/permis-ocr-bench Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 2 Processing Time: 1.3 min Processing Date: 2026-08-11 13:48 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train… See the full description on the dataset page: https://huggingface.co/datasets/mehdigououiad/permis-ocr-glm.imagen<1K0 likes27 downloads1mo agoHugging Face06davanstrien /rubenstein-manuscript-catalog-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in biglam/rubenstein-manuscript-catalog using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: biglam/rubenstein-manuscript-catalog Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 49,654 Processing Time: 343.2 min Processing Date: 2026-02-14 15:38 UTC Configuration Image Column: image Output Column: markdown Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/rubenstein-manuscript-catalog-glm-ocr.image10K<n<100K0 likes21 downloads7mo agoHugging Face07davanstrien /nls-highland-news-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/nls-highland-news-sample using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/nls-highland-news-sample Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 68 Processing Time: 23.0 min Processing Date: 2026-02-20 17:32 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-highland-news-glm-ocr.imagen<1K0 likes20 downloads7mo agoHugging Face08andesco /risk-assessment-treatment-glm-ocrimagen<1K0 likes18 downloads7mo agoHugging Face09stephenmcconnachie /0004-glm-ocr-table Document OCR using GLM-OCR This dataset contains OCR results from images in stephenmcconnachie/0004-pdf-pages-test using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: stephenmcconnachie/0004-pdf-pages-test Model: zai-org/GLM-OCR Task: table recognition Number of Samples: 50 Processing Time: 3.4 min Processing Date: 2026-06-21 10:12 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/stephenmcconnachie/0004-glm-ocr-table.imagen<1K0 likes16 downloads3mo agoHugging Face10davanstrien /enc-brit-glm-ocr-v2-test Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 50 Processing Time: 9.5 min Processing Date: 2026-02-18 10:40 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/enc-brit-glm-ocr-v2-test.imagen<1K0 likes15 downloads7mo agoHugging Face11andesco /risk-management-3rd-glm-ocrimagen<1K0 likes14 downloads7mo agoHugging Face12yhan86 /uillinois1952image-glmocr Document OCR using GLM-OCR This dataset contains OCR results from images in yhan86/uillinois1952image using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: yhan86/uillinois1952image Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 14 Processing Time: 2.0 min Processing Date: 2026-04-02 18:38 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16… See the full description on the dataset page: https://huggingface.co/datasets/yhan86/uillinois1952image-glmocr.imagen<1K0 likes14 downloads6mo agoHugging Face13minhpvo /ocr-output_glm Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 13 Processing Time: 2.2 min Processing Date: 2026-02-07 15:51 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm.imagen<1K0 likes13 downloads8mo agoHugging Face14minhpvo /ocr-output_glm_formula Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: formula recognition Number of Samples: 13 Processing Time: 2.3 min Processing Date: 2026-02-09 04:16 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_formula.imagen<1K0 likes13 downloads8mo agoHugging Face15minhpvo /ocr-output_glm_ocr Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 13 Processing Time: 2.2 min Processing Date: 2026-02-09 04:12 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_ocr.imagen<1K0 likes12 downloads8mo agoHugging Face16davanstrien /bpl-card-catalog-glm-ocr-bench Document OCR using DeepSeek-OCR-2 This dataset contains markdown-formatted OCR results from images in davanstrien/bpl-card-catalog-glm-ocr-bench using DeepSeek-OCR-2. Processing Details Source Dataset: davanstrien/bpl-card-catalog-glm-ocr-bench Model: deepseek-ai/DeepSeek-OCR-2 Number of Samples: 500 Processing Time: 7.0 min Processing Date: 2026-02-14 17:26 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 8… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench.imagen<1K0 likes12 downloads7mo agoHugging Face17davanstrien /bpl-card-catalog-glm-ocr-bench-l4 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/bpl-card-catalog-with-ocr Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 500 Processing Time: 2.1 min Processing Date: 2026-02-13 13:03 UTC Configuration Image Column: image Output Column: markdown Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench-l4.imagen<1K0 likes12 downloads7mo agoHugging Face18davanstrien /nls-highland-news-segments-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/nls-highland-news-segments-fullres using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/nls-highland-news-segments-fullres Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 1,178 Processing Time: 3.9 min Processing Date: 2026-02-23 16:40 UTC Configuration Image Column: image Output Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-highland-news-segments-glm-ocr.image1K<n<10K1 likes12 downloads7mo agoHugging Face19davanstrien /glm-ocr-test-v2 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 2.1 min Processing Date: 2026-02-05 14:24 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v2.imagen<1K0 likes11 downloads8mo agoHugging Face20davanstrien /glm-ocr-test-v1 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 2.1 min Processing Date: 2026-02-05 14:00 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v1.imagen<1K0 likes10 downloads8mo agoHugging Face21minhpvo /ocr-output_glm_table Document OCR using GLM-OCR This dataset contains OCR results from images in minhpvo/ocr-input using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: minhpvo/ocr-input Model: zai-org/GLM-OCR Task: table recognition Number of Samples: 13 Processing Time: 2.3 min Processing Date: 2026-02-09 04:19 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max Model Length:… See the full description on the dataset page: https://huggingface.co/datasets/minhpvo/ocr-output_glm_table.imagen<1K0 likes10 downloads8mo agoHugging Face22davanstrien /bpl-card-catalog-glm-ocr-bench-l40s Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/bpl-card-catalog-with-ocr using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/bpl-card-catalog-with-ocr Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 500 Processing Time: 2.8 min Processing Date: 2026-02-13 13:04 UTC Configuration Image Column: image Output Column: markdown Dataset… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/bpl-card-catalog-glm-ocr-bench-l40s.imagen<1K0 likes10 downloads7mo agoHugging Face23davanstrien /glm-ocr-test-v3 Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ufo-ColPali using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ufo-ColPali Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 2.1 min Processing Date: 2026-02-05 14:35 UTC Configuration Image Column: image Output Column: markdown Dataset Split: train Batch Size: 16 Max… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v3.imagen<1K0 likes9 downloads8mo agoHugging Face24haguirre-rfnr /sroie-glm-ocr-chatimage10K<n<100K0 likes9 downloads7mo agoHugging Face25davanstrien /nls-medical-glm-ocr-test Document OCR using GLM-OCR This dataset contains OCR results from images in NationalLibraryOfScotland/medical-history-of-british-india using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: NationalLibraryOfScotland/medical-history-of-british-india Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 7.1 min Processing Date: 2026-02-12 14:22 UTC Configuration Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/nls-medical-glm-ocr-test.imagen<1K0 likes8 downloads7mo agoHugging Face26andesco /risk-management-3rd-glm-ocr-testimagen<1K0 likes8 downloads7mo agoHugging Face27davanstrien /ocr-affordances-glm Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/ocr-affordances-pages using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/ocr-affordances-pages Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 8 Processing Time: 2.9 min Processing Date: 2026-06-05 14:15 UTC Configuration Image Column: image Output Column: markdown Dataset Split:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/ocr-affordances-glm.imagen<1K1 likes7 downloads4mo agoHugging Face28davanstrien /encyclopaedia-britannica-1771-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in davanstrien/encyclopaedia-britannica-1771 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: davanstrien/encyclopaedia-britannica-1771 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 100 Processing Time: 9.0 min Processing Date: 2026-02-17 16:03 UTC Configuration Image Column: image Output Column: markdown… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/encyclopaedia-britannica-1771-glm-ocr.imagen<1K0 likes6 downloads7mo agoHugging Face29davanstrien /glm-ocr-test-v4 Document OCR using GLM-OCR This dataset contains OCR results from images in NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: NationalLibraryOfScotland/Britain-and-UK-Handbooks-Dataset Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 10 Processing Time: 4.1 min Processing Date: 2026-02-05 14:42 UTC Configuration Image Column:… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/glm-ocr-test-v4.imagen<1K0 likes5 downloads8mo agoHugging Face30davanstrien /highland-news-glm-ocr Document OCR using GLM-OCR This dataset contains OCR results from images in NationalLibraryOfScotland/Highland-News-1895-1922 using GLM-OCR, a compact 0.9B OCR model achieving SOTA performance. Processing Details Source Dataset: NationalLibraryOfScotland/Highland-News-1895-1922 Model: zai-org/GLM-OCR Task: text recognition Number of Samples: 100 Processing Time: 12.4 min Processing Date: 2026-02-06 10:39 UTC Configuration Image Column: image Output… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/highland-news-glm-ocr.imagen<1K0 likes5 downloads8mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.