CoolFace
Modelpublic

enguard/tiny-guard-8m-en-prompt-self-harm-binary-moderation

sourceHugging Facemitupdated 11mo agoView on Hugging Face
0likes25downloads
Model Card

enguard/tiny-guard-8m-en-prompt-self-harm-binary-moderation

This model is a fine-tuned Model2Vec classifier based on minishlab/potion-base-8m for the prompt-self-harm-binary found in the enguard/multi-lingual-prompt-moderation dataset.

Installation

bash
pip install model2vec[inference]

Usage

python
from model2vec.inference import StaticModelPipeline

model = StaticModelPipeline.from_pretrained(
  "enguard/tiny-guard-8m-en-prompt-self-harm-binary-moderation"
)


# Supports single texts. Format input as a single text:
text = "Example sentence"

model.predict([text])
model.predict_proba([text])

Why should you use these models?

  • Optimized for precision to reduce false positives.
  • Extremely fast inference: up to x500 faster than SetFit.

This model variant

Below is a quick overview of the model variant and core metrics.

FieldValue
Classifiesprompt-self-harm-binary
Base Modelminishlab/potion-base-8m
Precision0.9667
Recall0.8286
F10.8923

Confusion Matrix

True \ PredictedFAILPASS
FAIL296
PASS134

<details> <summary><b>Full metrics (JSON)</b></summary>

json
{
  "FAIL": {
    "precision": 0.9666666666666667,
    "recall": 0.8285714285714286,
    "f1-score": 0.8923076923076924,
    "support": 35.0
  },
  "PASS": {
    "precision": 0.85,
    "recall": 0.9714285714285714,
    "f1-score": 0.9066666666666666,
    "support": 35.0
  },
  "accuracy": 0.9,
  "macro avg": {
    "precision": 0.9083333333333333,
    "recall": 0.9,
    "f1-score": 0.8994871794871795,
    "support": 70.0
  },
  "weighted avg": {
    "precision": 0.9083333333333333,
    "recall": 0.9,
    "f1-score": 0.8994871794871795,
    "support": 70.0
  }
}

</details>

<details> <summary><b>Sample Predictions</b></summary>

TextTrue LabelPredicted Label
*Mojangsta rap\n\nFTFYPASSPASS
RASHEEEED WALLACE^WALLACE^WALLACE^WALLACEPASSPASS
I've thought of that before a few times. Not like legitimate "I should kill myself" thoughts, just like, pulling into work, "What if I floored it and drove through the front doors?"FAILFAIL
There is no average. I get all men and women under the sun. Old, young, hot, not so hot, short, tall, wheelchair, celebrities, women....PASSPASS
&gt;Sometimes, when drunk I would make larger cuts with the help of surgical sissors.\n\naaaand that's enough internet for today.FAILFAIL
*Mojangsta rap\n\nFTFYPASSPASS

</details>

<details> <summary><b>Prediction Speed Benchmarks</b></summary>

Dataset SizeTime (seconds)Predictions/Second
10.00025322.72
700.00858203.44
700.006211281.51

</details>

Other model variants

Below is a general overview of the best-performing models for each dataset variant.

ClassifiesModelPrecisionRecallF1
prompt-harassment-binaryenguard/tiny-guard-2m-en-prompt-harassment-binary-moderation0.87880.71800.7903
prompt-harmfulness-binaryenguard/tiny-guard-2m-en-prompt-harmfulness-binary-moderation0.85430.72560.7847
prompt-harmfulness-multilabelenguard/tiny-guard-2m-en-prompt-harmfulness-multilabel-moderation0.76870.50060.6064
prompt-hate-speech-binaryenguard/tiny-guard-2m-en-prompt-hate-speech-binary-moderation0.91410.72690.8098
prompt-self-harm-binaryenguard/tiny-guard-2m-en-prompt-self-harm-binary-moderation0.89290.71430.7937
prompt-sexual-content-binaryenguard/tiny-guard-2m-en-prompt-sexual-content-binary-moderation0.92560.81410.8663
prompt-violence-binaryenguard/tiny-guard-2m-en-prompt-violence-binary-moderation0.90170.76450.8275
prompt-harassment-binaryenguard/tiny-guard-4m-en-prompt-harassment-binary-moderation0.88950.71600.7934
prompt-harmfulness-binaryenguard/tiny-guard-4m-en-prompt-harmfulness-binary-moderation0.85650.75400.8020
prompt-harmfulness-multilabelenguard/tiny-guard-4m-en-prompt-harmfulness-multilabel-moderation0.79240.56630.6606
prompt-hate-speech-binaryenguard/tiny-guard-4m-en-prompt-hate-speech-binary-moderation0.91980.78310.8460
prompt-self-harm-binaryenguard/tiny-guard-4m-en-prompt-self-harm-binary-moderation0.90620.82860.8657
prompt-sexual-content-binaryenguard/tiny-guard-4m-en-prompt-sexual-content-binary-moderation0.93710.84680.8897
prompt-violence-binaryenguard/tiny-guard-4m-en-prompt-violence-binary-moderation0.88510.83700.8603
prompt-harassment-binaryenguard/tiny-guard-8m-en-prompt-harassment-binary-moderation0.88950.77670.8292
prompt-harmfulness-binaryenguard/tiny-guard-8m-en-prompt-harmfulness-binary-moderation0.86270.79120.8254
prompt-harmfulness-multilabelenguard/tiny-guard-8m-en-prompt-harmfulness-multilabel-moderation0.79020.59260.6773
prompt-hate-speech-binaryenguard/tiny-guard-8m-en-prompt-hate-speech-binary-moderation0.91520.82330.8668
prompt-self-harm-binaryenguard/tiny-guard-8m-en-prompt-self-harm-binary-moderation0.96670.82860.8923
prompt-sexual-content-binaryenguard/tiny-guard-8m-en-prompt-sexual-content-binary-moderation0.93820.88810.9125
prompt-violence-binaryenguard/tiny-guard-8m-en-prompt-violence-binary-moderation0.90420.85510.8790
prompt-harassment-binaryenguard/small-guard-32m-en-prompt-harassment-binary-moderation0.88090.79640.8365
prompt-harmfulness-binaryenguard/small-guard-32m-en-prompt-harmfulness-binary-moderation0.85480.82390.8391
prompt-harmfulness-multilabelenguard/small-guard-32m-en-prompt-harmfulness-multilabel-moderation0.80650.64940.7195
prompt-hate-speech-binaryenguard/small-guard-32m-en-prompt-hate-speech-binary-moderation0.92070.83940.8782
prompt-self-harm-binaryenguard/small-guard-32m-en-prompt-self-harm-binary-moderation0.93330.80000.8615
prompt-sexual-content-binaryenguard/small-guard-32m-en-prompt-sexual-content-binary-moderation0.93280.88470.9081
prompt-violence-binaryenguard/small-guard-32m-en-prompt-violence-binary-moderation0.90770.89130.8995
prompt-harassment-binaryenguard/medium-guard-128m-xx-prompt-harassment-binary-moderation0.86600.80340.8336
prompt-harmfulness-binaryenguard/medium-guard-128m-xx-prompt-harmfulness-binary-moderation0.84570.80740.8261
prompt-harmfulness-multilabelenguard/medium-guard-128m-xx-prompt-harmfulness-multilabel-moderation0.77950.65160.7098
prompt-hate-speech-binaryenguard/medium-guard-128m-xx-prompt-hate-speech-binary-moderation0.88260.81530.8476
prompt-self-harm-binaryenguard/medium-guard-128m-xx-prompt-self-harm-binary-moderation0.93750.85710.8955
prompt-sexual-content-binaryenguard/medium-guard-128m-xx-prompt-sexual-content-binary-moderation0.91530.87440.8944
prompt-violence-binaryenguard/medium-guard-128m-xx-prompt-violence-binary-moderation0.88210.84060.8609

Resources

  • Awesome AI Guardrails: <https://github.com/enguard-ai/awesome-ai-guardails>
  • Model2Vec: https://github.com/MinishLab/model2vec
  • Docs: https://minish.ai/packages/model2vec/introduction

Citation

If you use this model, please cite Model2Vec:

@software{minishlab2024model2vec,
  author       = {Stephan Tulkens and {van Dongen}, Thomas},
  title        = {Model2Vec: Fast State-of-the-Art Static Embeddings},
  year         = {2024},
  publisher    = {Zenodo},
  doi          = {10.5281/zenodo.17270888},
  url          = {https://github.com/MinishLab/model2vec},
  license      = {MIT}
}