Nachammai41/underserved-persona_conditioned-fraud-v3
Persona-Conditioned Fraud Detection Dataset (v3, Citation-Grounded) What's new in v3 vs v2 v2 generated personas from design assumptions. v3 grounds every load-bearing persona field in a real-world source (FinCEN advisories, FDIC microdata, Urban Institute reports, Menjívar et al. TPS survey, Del Real Venezuelan migration interviews, Remitly 10-K, Wise / Inter-American-Dialogue industry reports, Treasury OIG fraud alerts, IRS SOI filer statistics). Every fraud… See the full description on the dataset page: https://huggingface.co/datasets/Nachammai41/underserved-persona_conditioned-fraud-v3.
Persona-Conditioned Fraud Detection Dataset (v3, Citation-Grounded)
What's new in v3 vs v2
v2 generated personas from design assumptions. v3 grounds every load-bearing persona field in a real-world source (FinCEN advisories, FDIC microdata, Urban Institute reports, Menjívar et al. TPS survey, Del Real Venezuelan migration interviews, Remitly 10-K, Wise / Inter-American-Dialogue industry reports, Treasury OIG fraud alerts, IRS SOI filer statistics). Every fraud vector is mapped to a FinCEN typology code.
The generation machinery (TabDDPM-style persona-conditioned sampling with joint platform→hour→amount for gig workers, five v2 tightening rules, Adaption Labs narrative fill) is unchanged from v2 R4. Only the conditioning input — the persona profiles — is upgraded.
Three new universal columns on every transaction
Quick start
from datasets import load_dataset
# Full 20,000-row combined dataset
ds = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="all")["train"]
# One archetype
remit = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="remittance")["train"]
# Citation registry — look up a persona_source_id
sources = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="sources")["train"]
# FinCEN typology lookup — resolve fraud_vector_typology_ref
typology = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="typology_registry")["train"]Dataset Statistics
Archetypes
Available Configs
Transaction data:
- `all` — 20,000 rows across 4 archetypes
- `remittance` / `gig_worker` / `unbanked` / `itin` — 5,000 rows each
Reference / attribution:
- `personas` — 46 persona profiles with evidence grade, source IDs, per-field grounding
- `sources` — 13-entry citation registry
- `typology_registry` — 25 FinCEN typology codes with appliestofraud_vectors mapping
Schema (per transaction row)
Grade Distribution
Generation Pipeline
13 curated sources (PDFs + links)
└── Structured extraction (persona_dimensions per source)
└── 46 grounded persona profiles with per-field attribution
└── TabDDPM v3 generator (joint platform+hour sampling,
five v2 tightening rules, per-persona fraud-vector weighting,
FinCEN typology resolution)
└── 20,000-row transaction dataset (22 columns)
└── Adaption Labs narrative fill (persona-anchored prompts)
└── Final dataset with narrative_text (25 columns)Citation
@dataset{palaniappan2026underserved,
author = {Palaniappan, Nachammai},
title = {Underserved Financial Fraud Dataset},
year = {2026},
publisher = {HuggingFace},
note = {Created with Adaptive Data by Adaption.
Uncharted Data Challenge, Adaption Labs.},
url = {https://huggingface.co/datasets/nachammai779/underserved-financial-fraud}
}License
Released under CC-BY-4.0 for research and educational purposes. Persona names are fictional; biographical details are composed from published aggregate source evidence. Any resemblance to real individuals is coincidental.
Credits
- Adaption Labs — narrative fill via Enhanced Completion recipe
- FinCEN — Financial Trend Analysis 2024 (Identity), SAR Advisory Key Terms
- FDIC — 2023 National Survey of Unbanked and Underbanked Households
- Menjívar, Agadjanian & Oh — "The Contradictions of Liminal Legality" (Soc Probl 2022)
- Del Real — "Seemingly inclusive liminal legality" (J Ethn Migr Stud 2022)
- Vallas & Schor — "What Do Platforms Do?" (Annu Rev Sociol 2020)
- Remitly, Wise, Inter-American Dialogue, Oxfam America, IRS SOI, Treasury OIG, Federal Reserve (FedPayments Improvement) — industry & regulatory sources
- Tab-DDPM — Gaussian multinomial diffusion for tabular data (Kotelnikov et al.)
