CoolFace
Datasetpublic

lab-ii/sakha-ocr-synth

Синтетические строки якутского текста для OCR 500 000 изображений строк с точной разметкой. Сделано для обучения распознавателя якутского (саха) текста: готовые движки для этого языка не работают, а размеченных строк почти нет. Зачем вообще синтетика: у tesseract-rus и ABBYY FineReader 10 на якутской печати доля правильно прочитанных специфических букв ҕ ҥ ө һ ү равна нулю. Не «низкая» — ноль на 460 тысячах букв, при том что эти буквы составляют около 7% всех букв и встречаются… See the full description on the dataset page: https://huggingface.co/datasets/lab-ii/sakha-ocr-synth.

sourceHugging Facecc-by-4.0updated 16d agoView on Hugging Face
0likes145downloads
settings

This repository belongs to lab-ii on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namesakha-ocr-synth
visibilitypublic
licencecc-by-4.0
gatedno
ownerlab-ii
Account settings
lab-ii/sakha-ocr-synth · CoolFace