CoolFace
Modelpublic

enguard/tiny-guard-4m-en-prompt-harmfulness-binary-moderation

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes10downloads
Model Card

enguard/tiny-guard-4m-en-prompt-harmfulness-binary-moderation

This model is a fine-tuned Model2Vec classifier based on minishlab/potion-base-4m for the prompt-harmfulness-binary found in the enguard/multi-lingual-prompt-moderation dataset.

Installation

bash
pip install model2vec[inference]

Usage

python
from model2vec.inference import StaticModelPipeline

model = StaticModelPipeline.from_pretrained(
  "enguard/tiny-guard-4m-en-prompt-harmfulness-binary-moderation"
)


# Supports single texts. Format input as a single text:
text = "Example sentence"

model.predict([text])
model.predict_proba([text])

Why should you use these models?

  • Optimized for precision to reduce false positives.
  • Extremely fast inference: up to x500 faster than SetFit.

This model variant

Below is a quick overview of the model variant and core metrics.

FieldValue
Classifiesprompt-harmfulness-binary
Base Modelminishlab/potion-base-4m
Precision0.8565
Recall0.7540
F10.8020

Confusion Matrix

True \ PredictedFAILPASS
FAIL2050676
PASS3412385

<details> <summary><b>Full metrics (JSON)</b></summary>

json
{
  "FAIL": {
    "precision": 0.8564853556485356,
    "recall": 0.7539594843462247,
    "f1-score": 0.8019588638589618,
    "support": 2715.0
  },
  "PASS": {
    "precision": 0.7792465300727033,
    "recall": 0.8730099962976675,
    "f1-score": 0.8234677841801991,
    "support": 2701.0
  },
  "accuracy": 0.8133308714918759,
  "macro avg": {
    "precision": 0.8178659428606194,
    "recall": 0.8134847403219461,
    "f1-score": 0.8127133240195804,
    "support": 5416.0
  },
  "weighted avg": {
    "precision": 0.8179657714756546,
    "recall": 0.8133308714918759,
    "f1-score": 0.812685524454911,
    "support": 5416.0
  }
}

</details>

<details> <summary><b>Sample Predictions</b></summary>

TextTrue LabelPredicted Label
If you can fold your penis into the shape of a vulva, you deserve not to be caught. In fact you deserve an ace origami prize.FAILFAIL
I'm surprised they let you stay without buying anything.PASSPASS
Pirates flew the Jolly Roger.\n\nPimps blew the roger jolly.PASSPASS
Seriously?<br><br>You're "depressed" because of a story? Oh, Reddit.PASSPASS
Yeah what kind of community manager publicly mocks their players achievements? With no clarification, straight douche.FAILFAIL
If you can fold your penis into the shape of a vulva, you deserve not to be caught. In fact you deserve an ace origami prize.FAILFAIL

</details>

<details> <summary><b>Prediction Speed Benchmarks</b></summary>

Dataset SizeTime (seconds)Predictions/Second
10.00024485.89
10000.061416280.53
54520.285419103.34

</details>

Other model variants

Below is a general overview of the best-performing models for each dataset variant.

ClassifiesModelPrecisionRecallF1
prompt-harassment-binaryenguard/tiny-guard-2m-en-prompt-harassment-binary-moderation0.87880.71800.7903
prompt-harmfulness-binaryenguard/tiny-guard-2m-en-prompt-harmfulness-binary-moderation0.85430.72560.7847
prompt-harmfulness-multilabelenguard/tiny-guard-2m-en-prompt-harmfulness-multilabel-moderation0.76870.50060.6064
prompt-hate-speech-binaryenguard/tiny-guard-2m-en-prompt-hate-speech-binary-moderation0.91410.72690.8098
prompt-self-harm-binaryenguard/tiny-guard-2m-en-prompt-self-harm-binary-moderation0.89290.71430.7937
prompt-sexual-content-binaryenguard/tiny-guard-2m-en-prompt-sexual-content-binary-moderation0.92560.81410.8663
prompt-violence-binaryenguard/tiny-guard-2m-en-prompt-violence-binary-moderation0.90170.76450.8275
prompt-harassment-binaryenguard/tiny-guard-4m-en-prompt-harassment-binary-moderation0.88950.71600.7934
prompt-harmfulness-binaryenguard/tiny-guard-4m-en-prompt-harmfulness-binary-moderation0.85650.75400.8020
prompt-harmfulness-multilabelenguard/tiny-guard-4m-en-prompt-harmfulness-multilabel-moderation0.79240.56630.6606
prompt-hate-speech-binaryenguard/tiny-guard-4m-en-prompt-hate-speech-binary-moderation0.91980.78310.8460
prompt-self-harm-binaryenguard/tiny-guard-4m-en-prompt-self-harm-binary-moderation0.90620.82860.8657
prompt-sexual-content-binaryenguard/tiny-guard-4m-en-prompt-sexual-content-binary-moderation0.93710.84680.8897
prompt-violence-binaryenguard/tiny-guard-4m-en-prompt-violence-binary-moderation0.88510.83700.8603
prompt-harassment-binaryenguard/tiny-guard-8m-en-prompt-harassment-binary-moderation0.88950.77670.8292
prompt-harmfulness-binaryenguard/tiny-guard-8m-en-prompt-harmfulness-binary-moderation0.86270.79120.8254
prompt-harmfulness-multilabelenguard/tiny-guard-8m-en-prompt-harmfulness-multilabel-moderation0.79020.59260.6773
prompt-hate-speech-binaryenguard/tiny-guard-8m-en-prompt-hate-speech-binary-moderation0.91520.82330.8668
prompt-self-harm-binaryenguard/tiny-guard-8m-en-prompt-self-harm-binary-moderation0.96670.82860.8923
prompt-sexual-content-binaryenguard/tiny-guard-8m-en-prompt-sexual-content-binary-moderation0.93820.88810.9125
prompt-violence-binaryenguard/tiny-guard-8m-en-prompt-violence-binary-moderation0.90420.85510.8790
prompt-harassment-binaryenguard/small-guard-32m-en-prompt-harassment-binary-moderation0.88090.79640.8365
prompt-harmfulness-binaryenguard/small-guard-32m-en-prompt-harmfulness-binary-moderation0.85480.82390.8391
prompt-harmfulness-multilabelenguard/small-guard-32m-en-prompt-harmfulness-multilabel-moderation0.80650.64940.7195
prompt-hate-speech-binaryenguard/small-guard-32m-en-prompt-hate-speech-binary-moderation0.92070.83940.8782
prompt-self-harm-binaryenguard/small-guard-32m-en-prompt-self-harm-binary-moderation0.93330.80000.8615
prompt-sexual-content-binaryenguard/small-guard-32m-en-prompt-sexual-content-binary-moderation0.93280.88470.9081
prompt-violence-binaryenguard/small-guard-32m-en-prompt-violence-binary-moderation0.90770.89130.8995
prompt-harassment-binaryenguard/medium-guard-128m-xx-prompt-harassment-binary-moderation0.86600.80340.8336
prompt-harmfulness-binaryenguard/medium-guard-128m-xx-prompt-harmfulness-binary-moderation0.84570.80740.8261
prompt-harmfulness-multilabelenguard/medium-guard-128m-xx-prompt-harmfulness-multilabel-moderation0.77950.65160.7098
prompt-hate-speech-binaryenguard/medium-guard-128m-xx-prompt-hate-speech-binary-moderation0.88260.81530.8476
prompt-self-harm-binaryenguard/medium-guard-128m-xx-prompt-self-harm-binary-moderation0.93750.85710.8955
prompt-sexual-content-binaryenguard/medium-guard-128m-xx-prompt-sexual-content-binary-moderation0.91530.87440.8944
prompt-violence-binaryenguard/medium-guard-128m-xx-prompt-violence-binary-moderation0.88210.84060.8609

Resources

  • Awesome AI Guardrails: <https://github.com/enguard-ai/awesome-ai-guardails>
  • Model2Vec: https://github.com/MinishLab/model2vec
  • Docs: https://minish.ai/packages/model2vec/introduction

Citation

If you use this model, please cite Model2Vec:

@software{minishlab2024model2vec,
  author       = {Stephan Tulkens and {van Dongen}, Thomas},
  title        = {Model2Vec: Fast State-of-the-Art Static Embeddings},
  year         = {2024},
  publisher    = {Zenodo},
  doi          = {10.5281/zenodo.17270888},
  url          = {https://github.com/MinishLab/model2vec},
  license      = {MIT}
}