CoolFace
Datasetpublic

sherstpasha/StackMix-YeniseiGovReports-HWR

StackMix-YeniseiGovReports-HWR Базовое описание Набор данных StackMix-YeniseiGovReports-HWR содержит 788 428 синтетически сгенерированных изображений рукописных строк и слов в стиле отчётов губернаторов Енисейской губернии XIX века с соответствующими текстовыми расшифровками на русском языке. Датасет создан с использованием метода StackMix — техники искусственного увеличения данных для OCR/HTR путём наложения и смешивания фрагментов реальных изображений. Данные… See the full description on the dataset page: https://huggingface.co/datasets/sherstpasha/StackMix-YeniseiGovReports-HWR.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes81downloads
Dataset Card

StackMix-YeniseiGovReports-HWR

Базовое описание

Набор данных StackMix-YeniseiGovReports-HWR содержит 788 428 синтетически сгенерированных изображений рукописных строк и слов в стиле отчётов губернаторов Енисейской губернии XIX века с соответствующими текстовыми расшифровками на русском языке.

Датасет создан с использованием метода StackMix — техники искусственного увеличения данных для OCR/HTR путём наложения и смешивания фрагментов реальных изображений. Данные адаптированы под стиль рукописных губернаторских отчётов с дореформенной орфографией.

Набор предназначен для дообучения и повышения устойчивости моделей распознавания рукописного текста на исторических русских документах при дефиците размеченных данных.

Структура данных

Датасет содержит только обучающую выборку:

ВыборкаКоличество
Train788 428

Типичная структура репозитория:

  • —train/ — синтетические изображения печатного текста
  • —train.csv — метаданные и расшифровки

Каждая строка CSV содержит:

  • —filename — имя файла изображения
  • —text — эталонная расшифровка на русском языке

Метод StackMix

StackMix — метод аугментации данных для OCR/HTR, основанный на наложении синтетического текста на фрагменты реальных архивных изображений с сохранением визуального и семантического стиля исторических документов.

Процесс генерации

Новые образцы формируются путём:

  1. 1.Выбора фонового фрагмента из реальных архивных сканов
  2. 2.Наложения текста с дореформенной орфографией
  3. 3.Применения артефактов, характерных для исторических документов (шум, искажения, неравномерная освещённость, особенности типографики или почерка)

Источник и контекст

  • —Базовый датасет: YeniseiGovReports-HWR
  • —Словарь: Дореформенная орфография из губернаторских отчётов
  • —Цель: Расширение обучающих данных для моделей TPS-ResNet-BiLSTM-Attn и подобных

Датасет создан в рамках проекта по распознаванию отчётов губернаторов Енисейской губернии в Центре ИИ СФУ.

Примеры

№ИзображениеРасшифровка
1[image]лицейскомъ
2[image]отрубивъ
3[image]посовѣтовалася

Особенности

  • —Сохранение стиля исторических рукописей (почерк, наклон, плотность письма)
  • —Корректная дореформенная орфография (ѣ, ѳ, і, конечный ъ)
  • —Артефакты сканов: шум, пятна, неравномерная освещённость
  • —Разнообразие по длине строк и морфологической сложности

Применение

  • —Дообучение HTR-моделей при ограниченном объёме реальных данных
  • —Повышение обобщающей способности OCR-систем на исторических текстах
  • —Исследования эффективности синтетических аугментаций StackMix для OCR

Ограничения

Синтетические данные могут не полностью воспроизводить редкие почерки или дефекты конкретных документов. Рекомендуется комбинировать с реальными данными.

Благодарности

Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.

Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» - VII очередь.

Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.