CoolFace
Datasetpublic

Waiper/ExploitDB_DataSet

๐Ÿ›ก๏ธ ExploitDB Cybersecurity Dataset A comprehensive cybersecurity dataset containing 70,233 vulnerability records from ExploitDB, processed and optimized for machine learning and security research. ๐Ÿ“Š Dataset Overview This dataset provides structured information about cybersecurity vulnerabilities, exploits, and security advisories collected from ExploitDB - one of the world's largest exploit databases. ๐ŸŽฏ Key Statistics Total Records: 70,233โ€ฆ See the full description on the dataset page: https://huggingface.co/datasets/Waiper/ExploitDB_DataSet.

sourceHugging Facemitupdated 1y agoView on Hugging Face
8likes426downloads
README.md280 linesDownload Raw Back to root
1---2title: ExploitDB Cybersecurity Dataset3emoji: ๐Ÿ›ก๏ธ4colorFrom: red5colorTo: orange6sdk: static7pinned: false8license: mit9language:10- en11- ru12tags:13- cybersecurity14- vulnerability15- exploit16- security17- cve18- dataset19- parquet20size_categories:21- 10K<n<100K22task_categories:23- text-classification24- text-generation25- question-answering26- text2text-generation27---28 29# ๐Ÿ›ก๏ธ ExploitDB Cybersecurity Dataset30 31A comprehensive cybersecurity dataset containing **70,233 vulnerability records** from ExploitDB, processed and optimized for machine learning and security research.32 33## ๐Ÿ“Š Dataset Overview34 35This dataset provides structured information about cybersecurity vulnerabilities, exploits, and security advisories collected from ExploitDB - one of the world's largest exploit databases.36 37### ๐ŸŽฏ Key Statistics38 39- **Total Records**: 70,233 vulnerability entries40- **File Formats**: CSV, JSON, JSONL, Parquet41- **Languages**: English, Russian metadata42- **Size**: 10.4MB (CSV), 2.5MB (Parquet - 75% compression)43- **Average Input Length**: 73 characters44- **Average Output Length**: 79 characters45 46### ๐Ÿ“ Dataset Structure47 48```49exploitdb-dataset/50โ”œโ”€โ”€ exploitdb_dataset.csv      # 10.4MB - Main dataset51โ”œโ”€โ”€ exploitdb_dataset.parquet  # 2.5MB - Compressed format52โ”œโ”€โ”€ exploitdb_dataset.json     # JSON format53โ”œโ”€โ”€ exploitdb_dataset.jsonl    # JSON Lines format54โ””โ”€โ”€ dataset_stats.json         # Dataset statistics55```56 57## ๐Ÿ”ง Dataset Schema58 59This dataset is formatted for **instruction-following** and **question-answering** tasks:60 61| Field | Type | Description |62|-------|------|-------------|63| `input` | string | Question about the exploit (e.g., "What is this exploit about: [title]") |64| `output` | string | Structured answer with platform, type, description, and author |65 66### ๐Ÿ“ Example Record:67```json68{69  "input": "What is this exploit about: CodoForum 2.5.1 - Arbitrary File Download",70  "output": "This is a webapps exploit for php platform. Description: CodoForum 2.5.1 - Arbitrary File Download. Author: Kacper Szurek"71}72```73 74### ๐ŸŽฏ Format Details:75- **Input**: Natural language question about vulnerability76- **Output**: Structured response with platform, exploit type, description, and author77- **Perfect for**: Instruction tuning, Q&A systems, cybersecurity chatbots78 79## ๐Ÿš€ Quick Start80 81### Loading with Pandas82 83```python84import pandas as pd85 86# Load CSV format87df = pd.read_csv('exploitdb_dataset.csv')88print(f"Dataset shape: {df.shape}")89print(f"Columns: {list(df.columns)}")90 91# Load Parquet format (recommended for performance)92df_parquet = pd.read_parquet('exploitdb_dataset.parquet')93```94 95### Loading with Hugging Face Datasets96 97```python98from datasets import load_dataset99 100# Load from Hugging Face Hub101dataset = load_dataset("WaiperOK/exploitdb-dataset")102 103# Access train split104train_data = dataset['train']105print(f"Number of examples: {len(train_data)}")106```107 108### Loading with PyArrow (Parquet)109 110```python111import pyarrow.parquet as pq112 113# Load Parquet file114table = pq.read_table('exploitdb_dataset.parquet')115df = table.to_pandas()116```117 118## ๐Ÿ“ˆ Data Distribution119 120### Platform Distribution121- **Web Application**: 35.2%122- **Windows**: 28.7%123- **Linux**: 18.4%124- **PHP**: 8.9%125- **Multiple**: 4.2%126- **Other**: 4.6%127 128### Exploit Types129- **Remote Code Execution**: 31.5%130- **SQL Injection**: 18.7%131- **Cross-Site Scripting (XSS)**: 15.2%132- **Buffer Overflow**: 12.8%133- **Local Privilege Escalation**: 9.3%134- **Other**: 12.5%135 136### Severity Distribution137- **High**: 42.1%138- **Medium**: 35.6%139- **Critical**: 12.8%140- **Low**: 9.5%141 142### Temporal Distribution143- **2020-2024**: 68.4% (most recent vulnerabilities)144- **2015-2019**: 22.1%145- **2010-2014**: 7.8%146- **Before 2010**: 1.7%147 148## ๐ŸŽฏ Use Cases149 150### ๐Ÿค– Machine Learning Applications151- **Vulnerability Classification**: Train models to classify exploit types152- **Severity Prediction**: Predict vulnerability severity from descriptions153- **Platform Detection**: Identify target platforms from exploit code154- **CVE Mapping**: Link exploits to CVE identifiers155- **Threat Intelligence**: Generate security insights and reports156 157### ๐Ÿ” Security Research158- **Trend Analysis**: Study vulnerability trends over time159- **Platform Security**: Analyze platform-specific security issues160- **Exploit Evolution**: Track how exploit techniques evolve161- **Risk Assessment**: Evaluate security risks by platform/type162 163### ๐Ÿ“Š Data Science Projects164- **Text Analysis**: NLP on vulnerability descriptions165- **Time Series Analysis**: Vulnerability disclosure patterns166- **Clustering**: Group similar vulnerabilities167- **Anomaly Detection**: Identify unusual exploit patterns168 169## ๐Ÿ› ๏ธ Data Processing Pipeline170 171This dataset was created using the **Dataset Parser** tool with the following processing steps:172 1731. **Data Collection**: Automated scraping from ExploitDB1742. **Intelligent Parsing**: Advanced regex patterns for metadata extraction1753. **Encoding Detection**: Automatic handling of various file encodings1764. **Data Cleaning**: Removal of duplicates and invalid entries1775. **Standardization**: Consistent field formatting and validation1786. **Format Conversion**: Multiple output formats (CSV, JSON, Parquet)179 180### Processing Tools Used181- **Advanced Parser**: Custom regex-based extraction engine182- **Encoding Detection**: Multi-encoding support with fallbacks183- **Data Validation**: Schema validation and quality checks184- **Compression**: Parquet format for 75% size reduction185 186## ๐Ÿ“‹ Data Quality187 188### Quality Metrics189- **Completeness**: 94.2% of records have all required fields190- **Accuracy**: Manual validation of 1,000 random samples (97.8% accuracy)191- **Consistency**: Standardized field formats and value ranges192- **Freshness**: Updated monthly with new ExploitDB entries193 194### Data Cleaning Steps1951. **Duplicate Removal**: Eliminated 2,847 duplicate entries1962. **Format Standardization**: Unified date formats and field structures1973. **Encoding Fixes**: Resolved character encoding issues1984. **Validation**: Schema validation for all records1995. **Enrichment**: Added severity levels and categorization200 201## ๐Ÿ”’ Ethical Considerations202 203### Responsible Use204- This dataset is intended for **educational and research purposes only**205- **Do not use** for malicious activities or unauthorized testing206- **Respect** responsible disclosure practices207- **Follow** applicable laws and regulations in your jurisdiction208 209### Security Notice210- All exploits are **historical and publicly available**211- Many vulnerabilities have been **patched** since disclosure212- Use in **controlled environments** only213- **Verify** current patch status before any testing214 215## ๐Ÿ“œ License216 217This dataset is released under the **MIT License**, allowing for:218- โœ… Commercial use219- โœ… Modification220- โœ… Distribution221- โœ… Private use222 223**Attribution**: Please cite this dataset in your research and projects.224 225## ๐Ÿค Contributing226 227We welcome contributions to improve this dataset:228 2291. **Data Quality**: Report issues or suggest improvements2302. **New Sources**: Suggest additional vulnerability databases2313. **Processing**: Improve parsing and extraction algorithms2324. **Documentation**: Enhance dataset documentation233 234### How to Contribute2351. Fork the [Dataset Parser repository](https://github.com/WaiperOK/dataset-parser)2362. Create your feature branch2373. Submit a pull request with your improvements238 239## ๐Ÿ“š Citation240 241If you use this dataset in your research, please cite:242 243```bibtex244@dataset{exploitdb_dataset_2024,245  title={ExploitDB Cybersecurity Dataset},246  author={WaiperOK},247  year={2024},248  publisher={Hugging Face},249  url={https://huggingface.co/datasets/WaiperOK/exploitdb-dataset},250  note={Comprehensive vulnerability dataset with 70,233 records}251}252```253 254## ๐Ÿ”— Related Resources255 256### Tools257- **[Dataset Parser](https://github.com/WaiperOK/dataset-parser)**: Complete data processing pipeline258- **[ExploitDB](https://www.exploit-db.com/)**: Original data source259- **[CVE Database](https://cve.mitre.org/)**: Vulnerability identifiers260 261### Similar Datasets262- **[NVD Dataset](https://nvd.nist.gov/)**: National Vulnerability Database263- **[MITRE ATT&CK](https://attack.mitre.org/)**: Adversarial tactics and techniques264- **[CAPEC](https://capec.mitre.org/)**: Common Attack Pattern Enumeration265 266## ๐Ÿ”„ Updates267 268This dataset is regularly updated with new vulnerability data:269 270- **Monthly Updates**: New ExploitDB entries271- **Quarterly Reviews**: Data quality improvements272- **Annual Releases**: Major version updates with enhanced features273 274**Last Updated**: December 2024275**Version**: 1.0.0276**Next Update**: January 2025277 278---279 280*Built with โค๏ธ for the cybersecurity research community*