alvi42/prompt-injection-guard-v1
016
Prompt Injection Guard — Classifier v1
Model Description
DeBERTa-v3-base fine-tuned for binary prompt injection detection. Classifies user inputs to LLM applications as benign or injection attempt.
Built as part of a 35-day portfolio project targeting the Anthropic Safeguards ML/Research Engineer role.
Training Data
Four public datasets unified into a single DuckDB schema after MinHash deduplication: 11,690 examples total. Train/val/test split: 70/15/15, stratified by attack category.
Training Details
- Base model: microsoft/deberta-v3-base
- Epochs: 3, Learning rate: 2e-5, Batch size: 16
- Training time: ~28 minutes on Colab T4
Evaluation Results (Held-Out Test Set, n=1,754)
Per-Category F1
Repository
https://github.com/Shihabuddin-Alvi/prompt-injection-guard
