CoolFace
Datasetpublic

sherstpasha/StackMix-YeniseiGovReports-PRT

StackMix-YeniseiGovReports-PRT Базовое описание Набор данных StackMix-YeniseiGovReports-PRT содержит 788 436 синтетически сгенерированных изображений печатных текстов в стиле отчётов губернаторов Енисейской губернии XIX века с соответствующими текстовыми расшифровками на русском языке. Датасет создан методом StackMix путём наложения реальных печатных фрагментов с синтетическим текстом дореформенной орфографии. Данные имитируют типографику и верстку исторических… See the full description on the dataset page: https://huggingface.co/datasets/sherstpasha/StackMix-YeniseiGovReports-PRT.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes46downloads
Dataset Card

StackMix-YeniseiGovReports-PRT

Базовое описание

Набор данных StackMix-YeniseiGovReports-PRT содержит 788 436 синтетически сгенерированных изображений печатных текстов в стиле отчётов губернаторов Енисейской губернии XIX века с соответствующими текстовыми расшифровками на русском языке.

Датасет создан методом StackMix путём наложения реальных печатных фрагментов с синтетическим текстом дореформенной орфографии. Данные имитируют типографику и верстку исторических печатных изданий.

Набор предназначен для дообучения OCR-моделей на печатных исторических текстах при недостатке размеченных данных.

Структура данных

Датасет содержит только обучающую выборку:

ВыборкаКоличество
Train788 436

Типичная структура репозитория:

  • —train/ — синтетические изображения печатного текста
  • —train.csv — метаданные и расшифровки

Каждая строка CSV содержит:

  • —filename — имя файла изображения
  • —text — эталонная расшифровка на русском языке

Метод StackMix

StackMix — метод аугментации данных для OCR/HTR, основанный на наложении синтетического текста на фрагменты реальных архивных изображений с сохранением визуального и семантического стиля исторических документов.

Процесс генерации

Новые образцы формируются путём:

  1. 1.Выбора фонового фрагмента из реальных архивных сканов
  2. 2.Наложения текста с дореформенной орфографией
  3. 3.Применения артефактов, характерных для исторических документов (шум, искажения, неравномерная освещённость, особенности типографики или почерка)

Источник и контекст

  • —Базовый датасет: YeniseiGovReports-PRT
  • —Словарь: Административная лексика губернаторских отчётов
  • —Цель: Аугментация данных для OCR-моделей типа TPS-ResNet-BiLSTM-Attn

Примеры

№ИзображениеРасшифровка
1[image]загромыхаютъ
2[image]актуализированъ
3[image]блаженствовавъ

Особенности

  • —Типографика XIX века (шрифты, кернинг, верстка)
  • —Дореформенная орфография полностью сохранена
  • —Артефакты печатных изданий и сканов

Применение

  • —Дообучение OCR на исторической печати
  • —Комбинированное обучение на печатном + рукописном тексте
  • —Тестирование методов аугментации StackMix для печатных OCR

Ограничения

Синтетика может не воспроизводить редкие шрифты или дефекты конкретных изданий. Используйте совместно с реальными данными.

Благодарности

Датасет подготовлен в рамках проекта по оцифровке и распознаванию отчётов губернаторов Енисейской губернии в Центре искусственного интеллекта Сибирского федерального университета.

Работа выполнена при поддержке гранта Фонда содействия инновациям «Код ИИ» - VII очередь.

Авторы также выражают благодарность сайту fromthepage.sfu-kras.ru за предоставленные архивные сканы.