SkywardNomad92/pentest-findings-v2
Pentest Security Findings Dataset v2 (Balanced) Balanced cybersecurity and penetration testing training data for fine-tuning LLMs. Key Improvements over v1 Balanced sources: CVE capped at 50K (was 240K+), underrepresented sources upsampled Quality filter: Stricter minimum assistant response length for capped sources Target: ~80-100K examples with better source diversity Source Distribution cve: 50,000 (46.8%) fenrir: 30,000 (28.1%) hackerone: 14… See the full description on the dataset page: https://huggingface.co/datasets/SkywardNomad92/pentest-findings-v2.
179
Pentest Security Findings Dataset v2 (Balanced)
Balanced cybersecurity and penetration testing training data for fine-tuning LLMs.
Key Improvements over v1
- Balanced sources: CVE capped at 50K (was 240K+), underrepresented sources upsampled
- Quality filter: Stricter minimum assistant response length for capped sources
- Target: ~80-100K examples with better source diversity
Source Distribution
- cve: 50,000 (46.8%)
- fenrir: 30,000 (28.1%)
- hackerone: 14,936 (14.0%)
- circl: 10,000 (9.4%)
- mitre_attack: 1,962 (1.8%)
Format
Each example is a 3-message chat conversation:
- system: Penetration testing expert persona
- user: Security question, vulnerability analysis request, or tool usage query
- assistant: Detailed security assessment with findings, impact, and remediation
Stats
- Train: 101,553 examples
- Validation: 5,345 examples
