zaakirio/infosec_harmful_behaviors
Infosec Harmful Behaviors Offensive-security instruction prompts for refusal-direction research and abliteration of code/security models. Dataset Details This dataset contains infosec-domain harmful prompts intended to elicit refusal behavior from aligned instruction models. It is designed as the harmful side of a harmful/harmless contrast pair, analogous to mlabonne/harmful_behaviors but focused on offensive-security and malicious-coding requests. Rows: train:… See the full description on the dataset page: https://huggingface.co/datasets/zaakirio/infosec_harmful_behaviors.
Infosec Harmful Behaviors
Offensive-security instruction prompts for refusal-direction research and abliteration of code/security models.
Dataset Details
This dataset contains infosec-domain harmful prompts intended to elicit refusal behavior from aligned instruction models. It is designed as the harmful side of a harmful/harmless contrast pair, analogous to mlabonne/harmful_behaviors but focused on offensive-security and malicious-coding requests.
Rows:
train: 400test: 120
Schema:
text: prompt string
Intended Use
Use this dataset for refusal-direction extraction, abliteration experiments, model evaluation, and interpretability research. The rows are instruction strings only; they do not include functional exploit code, malware, or payloads.
Usage
from datasets import load_dataset
dataset = load_dataset("zaakirio/infosec_harmful_behaviors")
train_prompts = dataset["train"]["text"]
test_prompts = dataset["test"]["text"]Heretic
[bad_prompts]
dataset = "zaakirio/infosec_harmful_behaviors"
split = "train[:400]"
column = "text"Source
Generated from data/infosec_harmful.txt in the infosec-refusal-prompts source tree.
License
MIT.
