CoolFace
Datasetpublic

sherstpasha/YeniseiGovReports-PRT

YeniseiGovReports-PRT Базовое описание Набор данных YeniseiGovReports-PRT содержит изображения печатных страниц и текстовых фрагментов из официальных отчётов губернаторов Енисейской губернии (Россия, XIX век) с соответствующими текстовыми расшифровками на русском языке. В отличие от рукописного набора, данный датасет сосредоточен на печатной типографике исторических отчётов с сохранением орфографии, лексики и оформления того периода. Набор предназначен для… See the full description on the dataset page: https://huggingface.co/datasets/sherstpasha/YeniseiGovReports-PRT.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes61downloads
Dataset Card

YeniseiGovReports-PRT

Базовое описание

Набор данных YeniseiGovReports-PRT содержит изображения печатных страниц и текстовых фрагментов из официальных отчётов губернаторов Енисейской губернии (Россия, XIX век) с соответствующими текстовыми расшифровками на русском языке.

В отличие от рукописного набора, данный датасет сосредоточен на печатной типографике исторических отчётов с сохранением орфографии, лексики и оформления того периода.

Набор предназначен для обучения и оценки моделей OCR для исторического печатного русского текста.

Структура данных

Датасет разделён на обучающую и тестовую выборки:

ВыборкаКоличество
Train95 366
Test15 524

Типичная структура репозитория:

  • —train/ — изображения печатных страниц или текстовых сегментов
  • —train.csv — метаданные и расшифровки для обучающей выборки
  • —test/ — изображения для оценки
  • —test.csv — метаданные и расшифровки для тестовой выборки

Каждая строка CSV содержит:

  • —filename — имя файла изображения
  • —text — эталонная расшифровка на русском языке

Примеры

№ИзображениеРасшифровка
1[image]числѣ
2[image]смирительныѣ
3[image]отдѣленiю

Источник и контекст

Исходные документы — официальные отчёты губернаторов Енисейской губернии XIX века, хранящиеся в российских архивах. Отчёты охватывают административную, экономическую, социальную, демографическую и инфраструктурную информацию о регионе.

Печатный датасет дополняет рукописный, позволяя проводить совместные эксперименты на смешанных рукописно-печатных потоках и повышать устойчивость систем распознавания для реальных архивных материалов.

Особенности текста

Тексты отчётов имеют ряд особенностей, затрудняющих использование стандартных решений для распознавания:

  • —Дореформенная орфография с устаревшими буквами (ѣ, ѳ, і) и правилами написания
  • —Специализированная административная и бюрократическая лексика XIX века
  • —Артефакты сканирования: разводы чернил, пятна, перекосы страниц

Применение

  • —Обучение и бенчмаркинг моделей OCR на историческом печатном русском тексте
  • —Совместное использование с рукописным датасетом для сквозных конвейеров обработки
  • —Исследования в области цифровых гуманитарных наук и массового извлечения текста из исторических источников

Ограничения

Контент специфичен для предметной области (официальные отчёты одной губернии), что может ограничить прямой перенос на другие типы исторической печати. Типографика и орфография отражают нормы XIX века.

Благодарности

Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.

Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» - VII очередь.

Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.