CoolFace
Datasetpublic

sherstpasha/YeniseiGovReports-HWR

YeniseiGovReports-HWR Базовое описание Набор данных YeniseiGovReports-HWR содержит изображения рукописных строк и слов из официальных отчётов губернаторов Енисейской губернии (Россия, XIX век) с соответствующими текстовыми расшифровками на русском языке. Документы написаны дореформенным русским языком и отражают административные, экономические, социальные и демографические аспекты жизни региона с первой половины XIX века до начала XX века. Датасет подготовлен в… See the full description on the dataset page: https://huggingface.co/datasets/sherstpasha/YeniseiGovReports-HWR.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
1likes68downloads
Dataset Card

YeniseiGovReports-HWR

Базовое описание

Набор данных YeniseiGovReports-HWR содержит изображения рукописных строк и слов из официальных отчётов губернаторов Енисейской губернии (Россия, XIX век) с соответствующими текстовыми расшифровками на русском языке.

Документы написаны дореформенным русским языком и отражают административные, экономические, социальные и демографические аспекты жизни региона с первой половины XIX века до начала XX века. Датасет подготовлен в рамках проекта по оцифровке и распознаванию губернаторских отчётов в Центре искусственного интеллекта Сибирского федерального университета (Красноярск).

Набор предназначен для обучения и оценки моделей распознавания исторического рукописного текста (HTR) на русском языке, включая адаптацию к дореформенной орфографии и историческим почеркам.

Структура данных

Датасет разделён на обучающую и тестовую выборки:

ВыборкаКоличество
Train124 812
Test22 623

Типичная структура репозитория:

  • —train/ — изображения рукописного текста (строки или сегменты слов)
  • —train.csv — метаданные и расшифровки для обучающей выборки
  • —test/ — изображения для оценки
  • —test.csv — метаданные и расшифровки для тестовой выборки

Каждая строка CSV содержит:

  • —filename — имя файла изображения
  • —text — эталонная расшифровка на русском языке (с дореформенной орфографией)

Примеры

№ИзображениеРасшифровка
1[image]свѣрхъ
2[image]№4046-мъ
3[image]обращает

Источник и контекст

Материал взят из официальных отчётов губернаторов Енисейской губернии. Отчёты содержат информацию о населении, экономике, инфраструктуре, социальной сфере, здравоохранении, образовании, правопорядке и других аспектах жизни региона.

Особенности текста

Тексты отчётов имеют ряд особенностей, затрудняющих использование стандартных решений для распознавания:

  • —Дореформенная орфография с устаревшими буквами (ѣ, ѳ, і) и правилами написания
  • —Специализированная административная и бюрократическая лексика XIX века
  • —Разнообразие почерков и каллиграфических стилей того времени
  • —Артефакты сканирования: разводы чернил, пятна, перекосы страниц

Применение

  • —Обучение и оценка моделей HTR/OCR на исторических русских рукописях
  • —Доменная адаптация для дореформенного русского текста
  • —Исследования в области цифровых гуманитарных наук и массового извлечения текста из исторических источников

Ограничения

Датасет охватывает специфическую предметную область (административные отчёты одной губернии), поэтому модели, обученные только на этих данных, могут плохо обобщаться на другие типы рукописей. Ручные расшифровки могут содержать отдельные ошибки.

Благодарности

Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.

Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» - VII очередь.

Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.