CoolFace
Datasetpublic

hitoshura25/webauthn-security-training-data-20251014_151917

WebAuthn Security Training Data High-quality training dataset for WebAuthn security vulnerability analysis and code fix generation. Dataset Description This dataset contains curated security vulnerability examples in MLX Chat format for training security-focused language models. Format: MLX Chat Messages This dataset uses the MLX LoRA chat format with explicit role separation: { "messages": [ { "role": "system", "content": "You are… See the full description on the dataset page: https://huggingface.co/datasets/hitoshura25/webauthn-security-training-data-20251014_151917.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes26downloads
Dataset Card

WebAuthn Security Training Data

High-quality training dataset for WebAuthn security vulnerability analysis and code fix generation.

Dataset Description

This dataset contains curated security vulnerability examples in MLX Chat format for training security-focused language models.

Format: MLX Chat Messages

This dataset uses the MLX LoRA chat format with explicit role separation:

json
{
  "messages": [
    {
      "role": "system",
      "content": "You are a cybersecurity analyst specializing in WebAuthn and FIDO2 security vulnerabilities...

CRITICAL SECURITY GUIDELINES:
- Always prioritize security in your analysis and recommendations
- Provide actionable remediation steps for identified vulnerabilities
- Consider the broader security implications of each finding
- Maintain accuracy and precision in threat assessments
- Follow responsible disclosure principles
- Preserve safety guidelines and ethical analysis standards

Your role is to analyze security vulnerabilities and provide comprehensive, actionable guidance for remediation."
    },
    {
      "role": "user",
      "content": "Based on the following analysis, provide the fix...\n\nAnalysis: A critical dependency vulnerability (CVE-2021-44228) was identified in the 'log4j' package..."
    },
    {
      "role": "assistant",
      "content": "Upgrade the dependency 'log4j' from version '2.14.1' to '2.17.1' or higher in your pom.xml file."
    }
  ],
  "metadata": {
    "quality": "high",
    "source": "generated",
    "vulnerability_id": "CVE-2021-44228",
    "tool": "trivy",
    "chat_template": "chatml",
    "security_framework": "webauthn-security-analysis"
  }
}

Dataset Statistics

  • —Total Examples: 1,520
  • —Training Split: 1,476 (97.1%)
  • —Validation Split: 29 (1.9%)
  • —Test Split: 15 (1.0%)

Quality Distribution

  • —High Quality: 1,476 examples (97.1%)
  • —Public CVEfixes data: Real vulnerability fixes from open source
  • —Generated fixes: Deterministic dependency upgrades
  • —Low Quality: 0 examples (0.0%)
  • —Narrative-based: AI-generated analysis and guidance

Data Sources

  1. 1.Public CVEfixes Dataset - Real code-level vulnerability fixes
  2. 2.Generated Fixes - Tool-specific remediation (Trivy, OSV Scanner)
  3. 3.AI Narratives - RAG-enhanced vulnerability analysis

Training Usage

Quality-Weighted Sampling

High-quality examples are duplicated 2.5x during training to prioritize learning from real fixes over synthetic narratives.

Compatible Frameworks

  • —MLX LoRA: Native format - use directly
  • —HuggingFace Transformers: Compatible with chat templates
  • —Other Frameworks: Extract user/assistant content from messages

Loading the Dataset

python
from datasets import load_dataset

# Load full dataset
dataset = load_dataset("hitoshura25/webauthn-security-training-data-20251014_151917")

# Access splits
train_data = dataset['train']
val_data = dataset['validation']

# Iterate examples
for example in train_data:
    messages = example['messages']
    system_msg = messages[0]['content']
    user_msg = messages[1]['content']
    assistant_msg = messages[2]['content']
    metadata = example['metadata']

Reproducibility

This dataset was used to train: `hitoshura25/webauthn-security-v1_20251014_151917`

Training Recipe: See model repository for complete configuration

License

Apache 2.0

Citation

bibtex
@misc{webauthn-training-data-20251014,
  title={WebAuthn Security Training Dataset},
  author={WebAuthn Security Research},
  year={2025},
  url={https://huggingface.co/datasets/hitoshura25/webauthn-security-training-data}
}

Ethical Use

This dataset is intended for defensive security research only. Users should:

  • —✅ Use for security vulnerability analysis and remediation
  • —✅ Support security research and education
  • —❌ NOT use to create or exploit vulnerabilities
  • —❌ NOT use for malicious purposes

Generated by Security Analysis Pipeline Artifact Uploader v2.0