Lucius-Morningstar/enron-correspondence-dedup
Enron Correspondence Deduplicated (Enriched GT, Agent-Blind Default) The deduplicated, ground-truth-enriched Enron correspondence benchmark: exact-duplicate bodies removed from the cleaned CMU Enron corpus (517,390 rows in → 247,523 unique-text rows out, 269,867 duplicates dropped; first occurrence wins on maildir-path order; empty bodies never deduped against each other). This dataset is the core evaluation corpus for the LLM Mailroom agent-sorting stack. ⚠️… See the full description on the dataset page: https://huggingface.co/datasets/Lucius-Morningstar/enron-correspondence-dedup.
KANBAN-103: patch demand/attorney_demand phrase-lexicon false positives
KANBAN-103: patch demand/attorney_demand phrase-lexicon false positives
KANBAN-103: correspondence GT overrides (phrase-lexicon false demands)
Dataset card: full best-practices pass (source attribution, licensing/PII, citation, mailroom refs; fix dead companion link)
Point dataset configs at parquet shards (fix JobManagerCrashedError)
Add pre-sharded parquet shards (viewer fix)
KANBAN-079: GT-enriched two-config republish (content_topic + sentiment; agent-blind default)
KANBAN-079: remove monolithic all-columns jsonl — GT must not fold into the default config
KANBAN-076 round-2 repair: ship manifest as manifest.txt (no json substring -> loader-invisible)
KANBAN-076 round-2 repair: remove manifest.json.txt (loader ingests ANY *.json* path - canary-proven)
Deduplicated Enron correspondence — exact-body-hash dedup (517,390->247,523 rows, KANBAN-076)
initial commit
