CoolFace
Datasetpublic

alrosait/pii-synthetic-ru

PII Synthetic Dataset (Russian) — pii-synthetic-ru Синтетический датасет для обучения NER-детектора персональных данных на русском языке. Содержит 4 500 примеров с аннотациями сущностей NAME (ФИО) и ADDRESS (адрес), а также негативные примеры без ПД. Создан в рамках проекта PIIDetector — гибридного детектора ПД для русского языка на базе Microsoft Presidio. Статистика Метрика Значение Всего примеров 4 500 Только NAME 1 113 Только ADDRESS 952 NAME… See the full description on the dataset page: https://huggingface.co/datasets/alrosait/pii-synthetic-ru.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
1likes82downloads
Dataset Card

PII Synthetic Dataset (Russian) — pii-synthetic-ru

Синтетический датасет для обучения NER-детектора персональных данных на русском языке. Содержит 4 500 примеров с аннотациями сущностей NAME (ФИО) и ADDRESS (адрес), а также негативные примеры без ПД.

Создан в рамках проекта PIIDetector — гибридного детектора ПД для русского языка на базе Microsoft Presidio.

Статистика

МетрикаЗначение
Всего примеров4 500
Только NAME1 113
Только ADDRESS952
NAME + ADDRESS1 409
Негативных (без сущностей)1 026
Всего NAME-сущностей2 748
Всего ADDRESS-сущностей2 569

Формат данных

Каждая строка — JSON-объект. Ключевые поля:

  • —`text` — русскоязычный текст примера
  • —`entities` — список аннотированных сущностей вида {"text": "...", "type": "NAME" | "ADDRESS"}. Значение text в каждой сущности является точной подстрокой поля text. Для негативных примеров список пустой.

Помимо этого каждый пример содержит метаданные генерации: домен текста, тип сущности, стиль, длину, тональность, наличие опечатки, флаг мультисущности и др.

Примечание: датасет пополнялся итеративно, и схема метаданных менялась в процессе. Поля expression и position отсутствуют у части ранних записей (650 и 1 500 примеров соответственно). Поля name_form, addr_form, neg_category, edge_case принимают значение null, когда неприменимы.

Методология генерации

Датасет генерировался итеративно с помощью LLM по детально описанным спецификациям. На каждой итерации случайно сэмплировались параметры примера (домен, стиль, тип сущности, длина и т.д.), после чего модель генерировала реалистичный текст с нужным контекстом. Результаты валидировались на соответствие формату и записывались в JSONL.

Подробное описание процесса генерации, схема параметров и весовые распределения доступны в репозитории проекта: github.com/dbashkirov/pii_detection.

Связанные артефакты

  • —Модель: alrosait/spacy_ru_core_news_lg_pii — spaCy NER для NAME/ADDRESS, обученная на данных, включающих этот датасет.