Waiper/ExploitDB_DataSet
๐ก๏ธ ExploitDB Cybersecurity Dataset A comprehensive cybersecurity dataset containing 70,233 vulnerability records from ExploitDB, processed and optimized for machine learning and security research. ๐ Dataset Overview This dataset provides structured information about cybersecurity vulnerabilities, exploits, and security advisories collected from ExploitDB - one of the world's largest exploit databases. ๐ฏ Key Statistics Total Records: 70,233โฆ See the full description on the dataset page: https://huggingface.co/datasets/Waiper/ExploitDB_DataSet.
8426
1---2title: ExploitDB Cybersecurity Dataset3emoji: ๐ก๏ธ4colorFrom: red5colorTo: orange6sdk: static7pinned: false8license: mit9language:10- en11- ru12tags:13- cybersecurity14- vulnerability15- exploit16- security17- cve18- dataset19- parquet20size_categories:21- 10K<n<100K22task_categories:23- text-classification24- text-generation25- question-answering26- text2text-generation27---28 29# ๐ก๏ธ ExploitDB Cybersecurity Dataset30 31A comprehensive cybersecurity dataset containing **70,233 vulnerability records** from ExploitDB, processed and optimized for machine learning and security research.32 33## ๐ Dataset Overview34 35This dataset provides structured information about cybersecurity vulnerabilities, exploits, and security advisories collected from ExploitDB - one of the world's largest exploit databases.36 37### ๐ฏ Key Statistics38 39- **Total Records**: 70,233 vulnerability entries40- **File Formats**: CSV, JSON, JSONL, Parquet41- **Languages**: English, Russian metadata42- **Size**: 10.4MB (CSV), 2.5MB (Parquet - 75% compression)43- **Average Input Length**: 73 characters44- **Average Output Length**: 79 characters45 46### ๐ Dataset Structure47 48```49exploitdb-dataset/50โโโ exploitdb_dataset.csv # 10.4MB - Main dataset51โโโ exploitdb_dataset.parquet # 2.5MB - Compressed format52โโโ exploitdb_dataset.json # JSON format53โโโ exploitdb_dataset.jsonl # JSON Lines format54โโโ dataset_stats.json # Dataset statistics55```56 57## ๐ง Dataset Schema58 59This dataset is formatted for **instruction-following** and **question-answering** tasks:60 61| Field | Type | Description |62|-------|------|-------------|63| `input` | string | Question about the exploit (e.g., "What is this exploit about: [title]") |64| `output` | string | Structured answer with platform, type, description, and author |65 66### ๐ Example Record:67```json68{69 "input": "What is this exploit about: CodoForum 2.5.1 - Arbitrary File Download",70 "output": "This is a webapps exploit for php platform. Description: CodoForum 2.5.1 - Arbitrary File Download. Author: Kacper Szurek"71}72```73 74### ๐ฏ Format Details:75- **Input**: Natural language question about vulnerability76- **Output**: Structured response with platform, exploit type, description, and author77- **Perfect for**: Instruction tuning, Q&A systems, cybersecurity chatbots78 79## ๐ Quick Start80 81### Loading with Pandas82 83```python84import pandas as pd85 86# Load CSV format87df = pd.read_csv('exploitdb_dataset.csv')88print(f"Dataset shape: {df.shape}")89print(f"Columns: {list(df.columns)}")90 91# Load Parquet format (recommended for performance)92df_parquet = pd.read_parquet('exploitdb_dataset.parquet')93```94 95### Loading with Hugging Face Datasets96 97```python98from datasets import load_dataset99 100# Load from Hugging Face Hub101dataset = load_dataset("WaiperOK/exploitdb-dataset")102 103# Access train split104train_data = dataset['train']105print(f"Number of examples: {len(train_data)}")106```107 108### Loading with PyArrow (Parquet)109 110```python111import pyarrow.parquet as pq112 113# Load Parquet file114table = pq.read_table('exploitdb_dataset.parquet')115df = table.to_pandas()116```117 118## ๐ Data Distribution119 120### Platform Distribution121- **Web Application**: 35.2%122- **Windows**: 28.7%123- **Linux**: 18.4%124- **PHP**: 8.9%125- **Multiple**: 4.2%126- **Other**: 4.6%127 128### Exploit Types129- **Remote Code Execution**: 31.5%130- **SQL Injection**: 18.7%131- **Cross-Site Scripting (XSS)**: 15.2%132- **Buffer Overflow**: 12.8%133- **Local Privilege Escalation**: 9.3%134- **Other**: 12.5%135 136### Severity Distribution137- **High**: 42.1%138- **Medium**: 35.6%139- **Critical**: 12.8%140- **Low**: 9.5%141 142### Temporal Distribution143- **2020-2024**: 68.4% (most recent vulnerabilities)144- **2015-2019**: 22.1%145- **2010-2014**: 7.8%146- **Before 2010**: 1.7%147 148## ๐ฏ Use Cases149 150### ๐ค Machine Learning Applications151- **Vulnerability Classification**: Train models to classify exploit types152- **Severity Prediction**: Predict vulnerability severity from descriptions153- **Platform Detection**: Identify target platforms from exploit code154- **CVE Mapping**: Link exploits to CVE identifiers155- **Threat Intelligence**: Generate security insights and reports156 157### ๐ Security Research158- **Trend Analysis**: Study vulnerability trends over time159- **Platform Security**: Analyze platform-specific security issues160- **Exploit Evolution**: Track how exploit techniques evolve161- **Risk Assessment**: Evaluate security risks by platform/type162 163### ๐ Data Science Projects164- **Text Analysis**: NLP on vulnerability descriptions165- **Time Series Analysis**: Vulnerability disclosure patterns166- **Clustering**: Group similar vulnerabilities167- **Anomaly Detection**: Identify unusual exploit patterns168 169## ๐ ๏ธ Data Processing Pipeline170 171This dataset was created using the **Dataset Parser** tool with the following processing steps:172 1731. **Data Collection**: Automated scraping from ExploitDB1742. **Intelligent Parsing**: Advanced regex patterns for metadata extraction1753. **Encoding Detection**: Automatic handling of various file encodings1764. **Data Cleaning**: Removal of duplicates and invalid entries1775. **Standardization**: Consistent field formatting and validation1786. **Format Conversion**: Multiple output formats (CSV, JSON, Parquet)179 180### Processing Tools Used181- **Advanced Parser**: Custom regex-based extraction engine182- **Encoding Detection**: Multi-encoding support with fallbacks183- **Data Validation**: Schema validation and quality checks184- **Compression**: Parquet format for 75% size reduction185 186## ๐ Data Quality187 188### Quality Metrics189- **Completeness**: 94.2% of records have all required fields190- **Accuracy**: Manual validation of 1,000 random samples (97.8% accuracy)191- **Consistency**: Standardized field formats and value ranges192- **Freshness**: Updated monthly with new ExploitDB entries193 194### Data Cleaning Steps1951. **Duplicate Removal**: Eliminated 2,847 duplicate entries1962. **Format Standardization**: Unified date formats and field structures1973. **Encoding Fixes**: Resolved character encoding issues1984. **Validation**: Schema validation for all records1995. **Enrichment**: Added severity levels and categorization200 201## ๐ Ethical Considerations202 203### Responsible Use204- This dataset is intended for **educational and research purposes only**205- **Do not use** for malicious activities or unauthorized testing206- **Respect** responsible disclosure practices207- **Follow** applicable laws and regulations in your jurisdiction208 209### Security Notice210- All exploits are **historical and publicly available**211- Many vulnerabilities have been **patched** since disclosure212- Use in **controlled environments** only213- **Verify** current patch status before any testing214 215## ๐ License216 217This dataset is released under the **MIT License**, allowing for:218- โ
Commercial use219- โ
Modification220- โ
Distribution221- โ
Private use222 223**Attribution**: Please cite this dataset in your research and projects.224 225## ๐ค Contributing226 227We welcome contributions to improve this dataset:228 2291. **Data Quality**: Report issues or suggest improvements2302. **New Sources**: Suggest additional vulnerability databases2313. **Processing**: Improve parsing and extraction algorithms2324. **Documentation**: Enhance dataset documentation233 234### How to Contribute2351. Fork the [Dataset Parser repository](https://github.com/WaiperOK/dataset-parser)2362. Create your feature branch2373. Submit a pull request with your improvements238 239## ๐ Citation240 241If you use this dataset in your research, please cite:242 243```bibtex244@dataset{exploitdb_dataset_2024,245 title={ExploitDB Cybersecurity Dataset},246 author={WaiperOK},247 year={2024},248 publisher={Hugging Face},249 url={https://huggingface.co/datasets/WaiperOK/exploitdb-dataset},250 note={Comprehensive vulnerability dataset with 70,233 records}251}252```253 254## ๐ Related Resources255 256### Tools257- **[Dataset Parser](https://github.com/WaiperOK/dataset-parser)**: Complete data processing pipeline258- **[ExploitDB](https://www.exploit-db.com/)**: Original data source259- **[CVE Database](https://cve.mitre.org/)**: Vulnerability identifiers260 261### Similar Datasets262- **[NVD Dataset](https://nvd.nist.gov/)**: National Vulnerability Database263- **[MITRE ATT&CK](https://attack.mitre.org/)**: Adversarial tactics and techniques264- **[CAPEC](https://capec.mitre.org/)**: Common Attack Pattern Enumeration265 266## ๐ Updates267 268This dataset is regularly updated with new vulnerability data:269 270- **Monthly Updates**: New ExploitDB entries271- **Quarterly Reviews**: Data quality improvements272- **Annual Releases**: Major version updates with enhanced features273 274**Last Updated**: December 2024275**Version**: 1.0.0276**Next Update**: January 2025277 278---279 280*Built with โค๏ธ for the cybersecurity research community* 