CoolFace
Datasetpublic

stindardlogic/prompt-injection-defense-dpo-3k

Prompt Injection Defense DPO (3K) DPO preference pairs training LLMs to detect and resist prompt injection attacks. Motivation As LLMs are deployed in agentic and production contexts, prompt injection — where malicious instructions are embedded in user input or retrieved documents — is a critical security threat. This dataset trains models to recognize and decline injection attempts while remaining helpful for legitimate queries. Dataset Description… See the full description on the dataset page: https://huggingface.co/datasets/stindardlogic/prompt-injection-defense-dpo-3k.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes30downloads
settings

This repository belongs to stindardlogic on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

nameprompt-injection-defense-dpo-3k
visibilitypublic
licenceapache-2.0
gatedno
ownerstindardlogic
Account settings
stindardlogic/prompt-injection-defense-dpo-3k · CoolFace