necrasov-ilya/ru-invoice-extraction-benchmark
Набор для извлечения данных из русскоязычных счетов 50 синтетических русскоязычных счетов с эталонными ответами в JSON. Набор не привязан к определённой модели и предназначен для проверки систем извлечения структурированных данных из текста. Разделы Раздел Документы Назначение development 30 разработка шаблонов и примеров validation 10 выбор настроек test 10 итоговая оценка Раздел test зафиксирован для версии 1. Его нельзя использовать для… See the full description on the dataset page: https://huggingface.co/datasets/necrasov-ilya/ru-invoice-extraction-benchmark.
Набор для извлечения данных из русскоязычных счетов
50 синтетических русскоязычных счетов с эталонными ответами в JSON. Набор не привязан к определённой модели и предназначен для проверки систем извлечения структурированных данных из текста.
Разделы
Раздел test зафиксирован для версии 1. Его нельзя использовать для обучения и подбора шаблонов.
Поля
id— постоянный идентификатор документаtext— текст счётаexpected— эталонный объект по схемеinvoice-v1currency,vat_amount,item_count— признаки для раздельной оценкиtemplate_family,vat_mode— вид документа и режим НДС
В development и validation находятся счета в рублях. В test находятся 5 счетов в рублях, 2 в долларах США, 2 в евро и 1 в юанях. Результаты следует публиковать для всего итогового раздела и отдельно для рублевых и нерублевых документов.
Синтетические ИНН имеют правильную длину, но контрольная цифра не гарантируется. Набор проверяет перенос значения из текста, а не его действительность.
Проверка качества
Все 50 эталонов проходят проверку по схеме JSON. Суммы позиций, подытоги, НДС и итоги согласованы. В выпуске нет точных и нормализованных дубликатов документов, повторяющихся ИНН и конфликтов между названиями организаций и реквизитами.
Лицензия и ограничения
Набор распространяется по Apache License 2.0. Все данные сгенерированы. Любые совпадения с реальными людьми, организациями, адресами или реквизитами случайны.
Набор не проверяет распознавание изображений, сканы PDF, рукописный текст, юридическую и бухгалтерскую корректность документов.
