lab-ii/sakha-ocr-synth
Синтетические строки якутского текста для OCR 500 000 изображений строк с точной разметкой. Сделано для обучения распознавателя якутского (саха) текста: готовые движки для этого языка не работают, а размеченных строк почти нет. Зачем вообще синтетика: у tesseract-rus и ABBYY FineReader 10 на якутской печати доля правильно прочитанных специфических букв ҕ ҥ ө һ ү равна нулю. Не «низкая» — ноль на 460 тысячах букв, при том что эти буквы составляют около 7% всех букв и встречаются… See the full description on the dataset page: https://huggingface.co/datasets/lab-ii/sakha-ocr-synth.
This repository belongs to lab-ii on Hugging Face.
CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.
