CoolFace
Modelpublic

alvi42/prompt-injection-guard-v1

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes16downloads
Model Card

Prompt Injection Guard — Classifier v1

Model Description

DeBERTa-v3-base fine-tuned for binary prompt injection detection. Classifies user inputs to LLM applications as benign or injection attempt.

Built as part of a 35-day portfolio project targeting the Anthropic Safeguards ML/Research Engineer role.

Training Data

Four public datasets unified into a single DuckDB schema after MinHash deduplication: 11,690 examples total. Train/val/test split: 70/15/15, stratified by attack category.

Training Details

  • —Base model: microsoft/deberta-v3-base
  • —Epochs: 3, Learning rate: 2e-5, Batch size: 16
  • —Training time: ~28 minutes on Colab T4

Evaluation Results (Held-Out Test Set, n=1,754)

MetricValue
Macro F10.9957
95% Bootstrap CI(0.9924, 0.9982)
Accuracy1.00
Injection Recall1.00
Injection Precision0.99

Per-Category F1

CategoryF1n
direct1.000092
jailbreak1.000026
systempromptleak1.000012
unknown0.99621566
role_play0.964457

Repository

https://github.com/Shihabuddin-Alvi/prompt-injection-guard