alrosait/pii-synthetic-ru
PII Synthetic Dataset (Russian) — pii-synthetic-ru Синтетический датасет для обучения NER-детектора персональных данных на русском языке. Содержит 4 500 примеров с аннотациями сущностей NAME (ФИО) и ADDRESS (адрес), а также негативные примеры без ПД. Создан в рамках проекта PIIDetector — гибридного детектора ПД для русского языка на базе Microsoft Presidio. Статистика Метрика Значение Всего примеров 4 500 Только NAME 1 113 Только ADDRESS 952 NAME… See the full description on the dataset page: https://huggingface.co/datasets/alrosait/pii-synthetic-ru.
PII Synthetic Dataset (Russian) — pii-synthetic-ru
Синтетический датасет для обучения NER-детектора персональных данных на русском языке. Содержит 4 500 примеров с аннотациями сущностей NAME (ФИО) и ADDRESS (адрес), а также негативные примеры без ПД.
Создан в рамках проекта PIIDetector — гибридного детектора ПД для русского языка на базе Microsoft Presidio.
Статистика
Формат данных
Каждая строка — JSON-объект. Ключевые поля:
- `text` — русскоязычный текст примера
- `entities` — список аннотированных сущностей вида
{"text": "...", "type": "NAME" | "ADDRESS"}. Значениеtextв каждой сущности является точной подстрокой поляtext. Для негативных примеров список пустой.
Помимо этого каждый пример содержит метаданные генерации: домен текста, тип сущности, стиль, длину, тональность, наличие опечатки, флаг мультисущности и др.
Примечание: датасет пополнялся итеративно, и схема метаданных менялась в процессе. Поляexpressionиpositionотсутствуют у части ранних записей (650 и 1 500 примеров соответственно). Поляname_form,addr_form,neg_category,edge_caseпринимают значениеnull, когда неприменимы.
Методология генерации
Датасет генерировался итеративно с помощью LLM по детально описанным спецификациям. На каждой итерации случайно сэмплировались параметры примера (домен, стиль, тип сущности, длина и т.д.), после чего модель генерировала реалистичный текст с нужным контекстом. Результаты валидировались на соответствие формату и записывались в JSONL.
Подробное описание процесса генерации, схема параметров и весовые распределения доступны в репозитории проекта: github.com/dbashkirov/pii_detection.
Связанные артефакты
- Модель: alrosait/spacy_ru_core_news_lg_pii — spaCy NER для NAME/ADDRESS, обученная на данных, включающих этот датасет.
