datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
khmer-ocr-200k-siemreap-arial
Khmer OCR 200k Siemreap Arial
This dataset contains 200,000 synthetic OCR text-line images for Khmer text recognition. It was generated for training CRNN-style Khmer OCR models such as ResNet34/ResNet18 + BiGRU + CTC.
Dataset Description
Each row contains:
image: rendered text-line image
text: ground-truth transcription
optional metadata such as source, script class, font, font size, colors, and padding values
The images are rendered at a fixed height of… See the full description on the dataset page: https://huggingface.co/datasets/KimkosalYon/khmer-ocr-200k-siemreap-arial.siemens_difficult_task2How-to-CAD-siemens-NXdiffusion_siemens_difficult_generalization_deployfranka-insert-siemens-lid-eval-normal-50franka-insert-siemens-lid-eval-ood-2-20franka-insert-siemens-lid-eval-ood-3-5franka-insert-siemens-lid-eval-ood-1-20franka-insert-siemens-lid-eval-6dof-7siemens_task
