kritsadaK/EDGAR-CORPUS-Financial-Summarization
EDGAR-CORPUS : 10K Financial Report Summarization Extracted from SEC EDGAR filings (1993-2020). This dataset enhances financial report summarization by leveraging a hybrid AI model strategy. Using: ChatGPT-3.5 Turbo(~70%), Claude 3.5 (~30% to generate structured, accurate, and concise summaries) Dataset Composition Summaries in this dataset are generated using a hybrid AI model strategy, balancing quality and efficiency:ChatGPT-3.5 Turbo (~70%) – Used for… See the full description on the dataset page: https://huggingface.co/datasets/kritsadaK/EDGAR-CORPUS-Financial-Summarization.
EDGAR-CORPUS : 10K Financial Report Summarization
Extracted from SEC EDGAR filings (1993-2020). This dataset enhances financial report summarization by leveraging a hybrid AI model strategy.
Using:
ChatGPT-3.5 Turbo(~70%),
Claude 3.5 (~30% to generate structured, accurate, and concise summaries)
Dataset Composition
Summaries in this dataset are generated using a hybrid AI model strategy, balancing quality and efficiency: ChatGPT-3.5 Turbo (~70%) – Used for structured, well-articulated summaries Claude 3.5 (~30%) – Two variants applied based on input size:
- Claude 3.5 Sonnet for longer and more detailed reports
- Claude 3.5 Haiku for shorter reports to optimize processing speed
Enhanced Summarization with spaCy (Claude Exclusive)
The dataset incorporates spaCy for NLP-based word tracking, applied only when processing with Claude models. This ensures:
- Balanced word distribution to prevent overfitting in AI training datasets
- Improved entity recognition for financial terms like revenue, net income, liabilities
- Adaptive model selection (Sonnet for long texts, Haiku for short ones)
- Keyword-driven extraction of essential financial metrics (e.g., EBITDA, market cap, stock price)
Example Row from the Dataset
Below is a real example from the dataset, showing a financial statement input, the AI-generated summary, and the model used:
Claude's Summary Style
ChatGPT's Summary style:
To Load this Dataset
from datasets import load_dataset
dataset = load_dataset("kritsadaK/EDGAR-CORPUS-Financial-Summarization")Limitations: Summary Accuracy & AI Hallucinations
AI-generated financial summaries are not 100% accurate without safeguards. This dataset incorporates:
- Entity Matching & Verification: spaCy NER cross-checks extracted financial terms.
- Consistency Checks: Rule-based validation prevents misinterpretation (e.g., net loss ≠ profit trend).
- Standardized Format: Aligns Claude and ChatGPT outputs for consistency.
- Bias & Overfitting Prevention: Balances structured data extraction with AI-generated summaries.
Despite these safeguards, users should verify summaries before relying on them for financial decisions.
The Financial Statements Summary 10K Dataset was developed as part of the CSX4210: Natural Language Processing project at Assumption University.
