sherstpasha/YeniseiGovReports-PRT
YeniseiGovReports-PRT Базовое описание Набор данных YeniseiGovReports-PRT содержит изображения печатных страниц и текстовых фрагментов из официальных отчётов губернаторов Енисейской губернии (Россия, XIX век) с соответствующими текстовыми расшифровками на русском языке. В отличие от рукописного набора, данный датасет сосредоточен на печатной типографике исторических отчётов с сохранением орфографии, лексики и оформления того периода. Набор предназначен для… See the full description on the dataset page: https://huggingface.co/datasets/sherstpasha/YeniseiGovReports-PRT.
YeniseiGovReports-PRT
Базовое описание
Набор данных YeniseiGovReports-PRT содержит изображения печатных страниц и текстовых фрагментов из официальных отчётов губернаторов Енисейской губернии (Россия, XIX век) с соответствующими текстовыми расшифровками на русском языке.
В отличие от рукописного набора, данный датасет сосредоточен на печатной типографике исторических отчётов с сохранением орфографии, лексики и оформления того периода.
Набор предназначен для обучения и оценки моделей OCR для исторического печатного русского текста.
Структура данных
Датасет разделён на обучающую и тестовую выборки:
Типичная структура репозитория:
train/— изображения печатных страниц или текстовых сегментовtrain.csv— метаданные и расшифровки для обучающей выборкиtest/— изображения для оценкиtest.csv— метаданные и расшифровки для тестовой выборки
Каждая строка CSV содержит:
filename— имя файла изображенияtext— эталонная расшифровка на русском языке
Примеры
Источник и контекст
Исходные документы — официальные отчёты губернаторов Енисейской губернии XIX века, хранящиеся в российских архивах. Отчёты охватывают административную, экономическую, социальную, демографическую и инфраструктурную информацию о регионе.
Печатный датасет дополняет рукописный, позволяя проводить совместные эксперименты на смешанных рукописно-печатных потоках и повышать устойчивость систем распознавания для реальных архивных материалов.
Особенности текста
Тексты отчётов имеют ряд особенностей, затрудняющих использование стандартных решений для распознавания:
- Дореформенная орфография с устаревшими буквами (ѣ, ѳ, і) и правилами написания
- Специализированная административная и бюрократическая лексика XIX века
- Артефакты сканирования: разводы чернил, пятна, перекосы страниц
Применение
- Обучение и бенчмаркинг моделей OCR на историческом печатном русском тексте
- Совместное использование с рукописным датасетом для сквозных конвейеров обработки
- Исследования в области цифровых гуманитарных наук и массового извлечения текста из исторических источников
Ограничения
Контент специфичен для предметной области (официальные отчёты одной губернии), что может ограничить прямой перенос на другие типы исторической печати. Типографика и орфография отражают нормы XIX века.
Благодарности
Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.
Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» - VII очередь.
Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.
