clawdia-chan/balanced-deberta
0
Balanced DeBERTa Prompt Guard
Fine-tuned DeBERTa-v3-base for prompt injection and jailbreak detection.
Model Details
- Base Model: microsoft/deberta-v3-base
- Training Data: 536 samples (prompt-guard-v2 dataset)
- 417 malicious (78%)
- 119 benign (22%)
Dataset Categories (30+)
Supported Threats (15+ types)
- Direct/Indirect Prompt Injection
- FlipAttack (character swapping)
- Jailbreak (DAN, role-play)
- Encoding Attacks (Base64, Hex, URL, HTML, Unicode)
- Multi-language jailbreak (中, 日, 韓, 西, 独, 露, etc.)
- RAG/Vector Poisoning
- Agent Chaining Attacks
- Memory Poisoning
Usage
from transformers import AutoModelForSequenceClassification, AutoTokenizer
model_name = "clawdia-chan/balanced-deberta"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)