CoolFace
Datasetpublic

Nachammai41/underserved-persona_conditioned-fraud-v3

Persona-Conditioned Fraud Detection Dataset (v3, Citation-Grounded) What's new in v3 vs v2 v2 generated personas from design assumptions. v3 grounds every load-bearing persona field in a real-world source (FinCEN advisories, FDIC microdata, Urban Institute reports, Menjívar et al. TPS survey, Del Real Venezuelan migration interviews, Remitly 10-K, Wise / Inter-American-Dialogue industry reports, Treasury OIG fraud alerts, IRS SOI filer statistics). Every fraud… See the full description on the dataset page: https://huggingface.co/datasets/Nachammai41/underserved-persona_conditioned-fraud-v3.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
0likes44downloads
Dataset Card

Persona-Conditioned Fraud Detection Dataset (v3, Citation-Grounded)

What's new in v3 vs v2

v2 generated personas from design assumptions. v3 grounds every load-bearing persona field in a real-world source (FinCEN advisories, FDIC microdata, Urban Institute reports, Menjívar et al. TPS survey, Del Real Venezuelan migration interviews, Remitly 10-K, Wise / Inter-American-Dialogue industry reports, Treasury OIG fraud alerts, IRS SOI filer statistics). Every fraud vector is mapped to a FinCEN typology code.

The generation machinery (TabDDPM-style persona-conditioned sampling with joint platform→hour→amount for gig workers, five v2 tightening rules, Adaption Labs narrative fill) is unchanged from v2 R4. Only the conditioning input — the persona profiles — is upgraded.

Three new universal columns on every transaction

FieldTypeDescription
persona_source_idslist[string]Citation IDs for real-world sources that grounded this record's persona
fraud_vector_typology_refstring (nullable)FinCEN SAR Advisory / FTA Identity typology code for the row's fraud_vector; null on legit rows
behavioral_evidence_gradestring A/B/C/DEvidence quality: A=ethnographic field interview; B=regulatory typology; C=industry research; D=synthetic design assumption

Quick start

python
from datasets import load_dataset

# Full 20,000-row combined dataset
ds = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="all")["train"]

# One archetype
remit = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="remittance")["train"]

# Citation registry — look up a persona_source_id
sources = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="sources")["train"]

# FinCEN typology lookup — resolve fraud_vector_typology_ref
typology = load_dataset("Nachammai41/underserved-persona_conditioned-fraud-v3", name="typology_registry")["train"]

Dataset Statistics

MetricValue
Total transactions20,000 (5,000 per archetype)
Total personas46 (12 remittance, 12 gig_worker, 10 unbanked, 12 ITIN)
Fraud rate~10% per archetype
Sources in registry13 (7 PDFs + 1 data bundle + 5 links)
FinCEN typology codes25 (14 FTA Identity 2024 + 11 SAR Advisory Key Terms)
Languages represented in narratives17+ (en, es, vi, ht, hi, mr, ta, te, yo, fr, am, tw, ru, zh, tl, ko, ar)
Overall grade distributionA 6.3% / B 50.0% / C 22.9% / D 20.8%

Archetypes

ArchetypePersonasKey DimensionsPrimary Source
Remittance12corridorcountry, transferserviceloyalty, familycrisishistory, sendertenureRemitly 10-K, Menjívar 2022, Del Real 2022, Wise 2023, IAD 2026
Gig Worker12platformmix, dailycashoutpattern, devicestability, sim_historyVallas & Schor 2020, FinCEN FTA 2024, Fed synthetic-ID
Unbanked10kiosklocation, prepaidcardstack, incomesource, documentation_statusFDIC 2023 HH Survey microdata (empirical distributions)
ITIN12businesstype, taxfilinghistory, creditfileage, accountantrelationshipMenjívar 2022 (former-TPS lapse), Treasury OIG, IRS SOI, FinCEN SAR

Available Configs

Transaction data:

  • —`all` — 20,000 rows across 4 archetypes
  • —`remittance` / `gig_worker` / `unbanked` / `itin` — 5,000 rows each

Reference / attribution:

  • —`personas` — 46 persona profiles with evidence grade, source IDs, per-field grounding
  • —`sources` — 13-entry citation registry
  • —`typology_registry` — 25 FinCEN typology codes with appliestofraud_vectors mapping

Schema (per transaction row)

FieldTypeDescription
data_uuidstringUnique identifier
persona_idstringSource persona (e.g., rem004, gig001) — join to personas
archetypestringremittance, gig_worker, unbanked, itin
dataset_versionstring"v3"
transactionamountusdfloatUSD amount
feeamountusdfloatUSD fee
sender_ageintPersona-derived age with jitter
hourofdayintPersona-window constrained hour
dayofweekint / stringDay index / name
dayssincelast_txnintCadence-derived interval
accountagedaysintTenure-derived account age
txncount30dintCadence-derived monthly count
instrumentstringPayment method / platform
languagestringFrom persona's language_mix
fraud_vectorstringFraud type or instrument label
narrative_textstringAdaption-generated first-person narrative
is_fraudint0 = legit, 1 = fraud
device_typestringPersona's device
device_stabilityfloatDevice churn proxy
record_timestampstringISO timestamp
persona_source_idslist[string]v3: citation IDs that grounded this record's persona
fraud_vector_typology_refstring (nullable)v3: FinCEN typology code for the fraud_vector
behavioral_evidence_gradestring A/B/C/Dv3: evidence quality grade

Grade Distribution

ArchetypeA (ethnographic)B (regulatory)C (industry)D (design)
Remittance16.7%25.0%41.7%16.7%
Gig Worker0%25.0%41.7%33.3%
Unbanked0%100%0%0%
ITIN8.3%50.0%8.3%33.3%

Generation Pipeline

13 curated sources (PDFs + links)
    └── Structured extraction (persona_dimensions per source)
        └── 46 grounded persona profiles with per-field attribution
            └── TabDDPM v3 generator (joint platform+hour sampling,
                five v2 tightening rules, per-persona fraud-vector weighting,
                FinCEN typology resolution)
                └── 20,000-row transaction dataset (22 columns)
                    └── Adaption Labs narrative fill (persona-anchored prompts)
                        └── Final dataset with narrative_text (25 columns)

Citation

bibtex
@dataset{palaniappan2026underserved,
  author    = {Palaniappan, Nachammai},
  title     = {Underserved Financial Fraud Dataset},
  year      = {2026},
  publisher = {HuggingFace},
  note      = {Created with Adaptive Data by Adaption.
               Uncharted Data Challenge, Adaption Labs.},
  url       = {https://huggingface.co/datasets/nachammai779/underserved-financial-fraud}
}

License

Released under CC-BY-4.0 for research and educational purposes. Persona names are fictional; biographical details are composed from published aggregate source evidence. Any resemblance to real individuals is coincidental.

Credits

  • —Adaption Labs — narrative fill via Enhanced Completion recipe
  • —FinCEN — Financial Trend Analysis 2024 (Identity), SAR Advisory Key Terms
  • —FDIC — 2023 National Survey of Unbanked and Underbanked Households
  • —Menjívar, Agadjanian & Oh — "The Contradictions of Liminal Legality" (Soc Probl 2022)
  • —Del Real — "Seemingly inclusive liminal legality" (J Ethn Migr Stud 2022)
  • —Vallas & Schor — "What Do Platforms Do?" (Annu Rev Sociol 2020)
  • —Remitly, Wise, Inter-American Dialogue, Oxfam America, IRS SOI, Treasury OIG, Federal Reserve (FedPayments Improvement) — industry & regulatory sources
  • —Tab-DDPM — Gaussian multinomial diffusion for tabular data (Kotelnikov et al.)