AI-aktindsigt/gdpr_anonymiseingsmodel_ganm
NLP NER-modeller udviklet under AI-aktindsigt projektet er trænet på tre forskellige måder: Enikke-privatbaseline model og to modeller trænet med differential privacy med hhv. ε=8 og ε=1 (se SmartNoise Whitepaper<sup>1</sup> og Learning with Privacy at Scale<sup>2</sup> for valg af ε i industrien). δ er sat til 1 over længden af træningsdatasættet (se LLM CAN BE STRONG DP LEARNERS<sup>3</sup>). Derudover er modellerne trænet med to forskellige sæt af entititer - med og uden entiteterne Forbrydelse og CPR-numre, som dog må anses som præmature for udstilling.
Modellen udstillet fremgå af nedenstående listen af forskellige træningsiterationer under navnet "sss-ner-dp-1 Special semantisk søgemodel finetunet på NER-annoterede aktindsigter med DP - ε = 1 excl. Forbrydelse og CPR"
Denne model kan anvendes til at fremsøge entiteter i de 7 følgende kategorier: 1) personer 2) lokationer 3) organisationer 4) helbredsoplysninger 5) adresser 6) kommuner og 7) telefonnumre.
Modellerne finetunet til Named Entity Recognition (NER)og er trænet til at forudsige følgende kategorier:
Datasæt
Modellerne er trænet på 49,191 unikke sætninger, og valideret på 2,359 sætninger, og testet på et data-sæt bestående af 125 entiteter fra hver kategori af entiteter som indgik i træningen. Data er blevet filtreret, opdelt i unikke sætninger og derefter inddelt i trænings-, test- og valideringssæt.
Eksempel på anvendelse af model
from transformers import pipeline
import pandas as pd
ner = pipeline(task='ner', model='../ner/models/sss-ner/best_model', aggregation_strategy='first')
sentence = 'Gunnar Hjering Nielsen er medarbejder i virksomheden Danske Sprogmodeller ApS og har ofte ekstrem hovedpine.' \
'Han bor på Hjortemarken 31, 2100 København Ø som ligger i Københavns Kommune.' \
'Hans tlf nummer er 12345560 og han er fra Danmark. Hjortemarken er centralt placeret i Københaven.'
result = ner(sentence)
print(pd.DataFrame.from_records(result))Nedenstående tabel viser de forskellige modellers Macro-F1 score.
Træningsprocedure hyperparametre
Hyperparametre anvendt i træningen
Framework versioner
• transformers 4.19.2
• opacus 1.2.0
• datasets 2.2.2
• numpy==1.22.3
• pytorch 1.13.0+cu11
Fuld dokumentation kan findes på AI aktindsigts Github linket under projektet her på Huggingface.
1 https://azure.microsoft.com/mediahandler/files/resourcefiles/microsoft-smartnoisedifferential-privacy-machine-learning-case-studies/SmartNoise%20Whitepaper%20Final%203.8.21.pdf
2 https://machinelearning.apple.com/research/learning-with-privacy-at-scale
