datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
pii-masking-financial-pfi-400k
👉 Looking for the open multilingual baseline? Start with
ai4privacy/pii-masking-openpii-1.5m
(1.5M samples, 30 languages, open-PII taxonomy).
🇪🇺🌏 Personal Financial Information, Global PII Dataset
Part of PII-Masking-3M by Ai4Privacy, the global
(2M base + Asia Pacific) PII-masking corpus.
📖 More information: www.ai4privacy.com/datasets/pii-masking-3m-asia-pacific
Entries
PII Annotations
Labels
Languages
Regions
426,660
2,587,698
38
30
37… See the full description on the dataset page: https://huggingface.co/datasets/ai4privacy/pii-masking-financial-pfi-400k.pfi-masking-100k
👉 Looking for the newest release? The current flagship is ai4privacy/pii-masking-openpii-1.5m. 1.6M samples, 30 languages, 19 PII classes, Asia Pacific extension.?** The current flagship is ai4privacy/pii-masking-openpii-1m. 1.4M samples, 23 languages, 19 PII classes.
EPII Personal Financial Information (PFI) Masking Preview Dataset
Overview
This dataset provides a preview (400 samples) of the EPII Personal Financial Information (PFI) Masking Dataset, a… See the full description on the dataset page: https://huggingface.co/datasets/ai4privacy/pfi-masking-100k.safe_druglike_QED_Pfizer_11m
Drug-like QED Pfizer 11M — SAFE Dataset
This dataset is derived from the Drug-like Molecule Datasets for Drug Discovery collection. Molecular structures were converted to SAFE (Sequential Attachment-based Fragment Embedding) representations using safe-mol v0.1.14.
Source
pii-masking-financial-pfi-200k
👉 Looking for the newest release? The current flagship is ai4privacy/pii-masking-openpii-1.5m. 1.6M samples, 30 languages, 19 PII classes, Asia Pacific extension.?** The current flagship is ai4privacy/pii-masking-openpii-1m. 1.4M samples, 23 languages, 19 PII classes.
🇪🇺 Personal Financial Information — European PII Dataset
Part of PII-Masking-2M (2,717,080 entries) by AI4Privacy
Entries
PII Annotations
Labels
Languages
Regions
257,434
1,563,807
48
23
29… See the full description on the dataset page: https://huggingface.co/datasets/ai4privacy/pii-masking-financial-pfi-200k.pfi-masking-100k-full
👉 Looking for the newest release? The current flagship is ai4privacy/pii-masking-openpii-1.5m. 1.6M samples, 30 languages, 19 PII classes, Asia Pacific extension.?** The current flagship is ai4privacy/pii-masking-openpii-1m. 1.4M samples, 23 languages, 19 PII classes.
EPII Personal Financial Information (PFI) Masking Dataset — Full
Overview
The EPII PFI Masking Dataset is a large-scale, multilingual dataset of 160,403 annotated text samples containing synthetic… See the full description on the dataset page: https://huggingface.co/datasets/ai4privacy/pfi-masking-100k-full.
