CoolFace
Datasetpublic

redmadrobot-rnd/pii_train

Russian PII NER Training Dataset Dataset Description This is the training corpus for PII (Personally Identifiable Information) detection and Named Entity Recognition (NER) on Russian-language text. It targets guardrail and anonymization pipelines that must reliably find personal data (names, addresses, contacts) and Russian identity-document numbers (passport, SNILS, INN, OMS, etc.) in text. The corpus combines real, manually annotated examples from production… See the full description on the dataset page: https://huggingface.co/datasets/redmadrobot-rnd/pii_train.

sourceHugging Facemitupdated 16d agoView on Hugging Face
1likes125downloads
3 commits on main
1a74b9f16d ago

Fix author name in citation

redmadrobot-rnd
962acad17d ago

Add Russian PII NER training dataset (17,137 sentences, 39,687 spans)

redmadrobot-rnd
4cf4cca17d ago

initial commit

redmadrobot-rnd