CoolFace
Datasetpublic

zaakirio/infosec_harmful_behaviors

Infosec Harmful Behaviors Offensive-security instruction prompts for refusal-direction research and abliteration of code/security models. Dataset Details This dataset contains infosec-domain harmful prompts intended to elicit refusal behavior from aligned instruction models. It is designed as the harmful side of a harmful/harmless contrast pair, analogous to mlabonne/harmful_behaviors but focused on offensive-security and malicious-coding requests. Rows: train:… See the full description on the dataset page: https://huggingface.co/datasets/zaakirio/infosec_harmful_behaviors.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
1likes23downloads
Dataset Card

Infosec Harmful Behaviors

Offensive-security instruction prompts for refusal-direction research and abliteration of code/security models.

Dataset Details

This dataset contains infosec-domain harmful prompts intended to elicit refusal behavior from aligned instruction models. It is designed as the harmful side of a harmful/harmless contrast pair, analogous to mlabonne/harmful_behaviors but focused on offensive-security and malicious-coding requests.

Rows:

  • —train: 400
  • —test: 120

Schema:

  • —text: prompt string

Intended Use

Use this dataset for refusal-direction extraction, abliteration experiments, model evaluation, and interpretability research. The rows are instruction strings only; they do not include functional exploit code, malware, or payloads.

Usage

python
from datasets import load_dataset

dataset = load_dataset("zaakirio/infosec_harmful_behaviors")
train_prompts = dataset["train"]["text"]
test_prompts = dataset["test"]["text"]

Heretic

toml
[bad_prompts]
dataset = "zaakirio/infosec_harmful_behaviors"
split = "train[:400]"
column = "text"

Source

Generated from data/infosec_harmful.txt in the infosec-refusal-prompts source tree.

License

MIT.