CoolFace
Modelpublic

clawdia-chan/balanced-deberta

sourceHugging Facemitupdated 7mo agoView on Hugging Face
0likes
Model Card

Balanced DeBERTa Prompt Guard

Fine-tuned DeBERTa-v3-base for prompt injection and jailbreak detection.

Model Details

  • —Base Model: microsoft/deberta-v3-base
  • —Training Data: 536 samples (prompt-guard-v2 dataset)
  • —417 malicious (78%)
  • —119 benign (22%)

Dataset Categories (30+)

CategoryCount
prompt_injection80+
jailbreak70+
flip_attack30+
encoding_attack50+
indirect_injection40+
role_override30+
privilege_escalation20+
agent_chaining20+
memory_poisoning15+
vector_poisoning15+
xss_attempt15+
sql_injection10+
benign119

Supported Threats (15+ types)

  • —Direct/Indirect Prompt Injection
  • —FlipAttack (character swapping)
  • —Jailbreak (DAN, role-play)
  • —Encoding Attacks (Base64, Hex, URL, HTML, Unicode)
  • —Multi-language jailbreak (中, 日, 韓, 西, 独, 露, etc.)
  • —RAG/Vector Poisoning
  • —Agent Chaining Attacks
  • —Memory Poisoning

Usage

python
from transformers import AutoModelForSequenceClassification, AutoTokenizer
model_name = "clawdia-chan/balanced-deberta"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)