CoolFace
Modelpublic

hivetrace/harm-qwen-2.5-3b-lora-responses

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes
Model Card

Content Metrics:

      Category  Safe Accuracy  Unsafe Accuracy
     discredit            0.94             0.92
discrimination            1.00             0.98
         drugs            0.96             0.95
    pedophilia            1.00             1.00
      religion            1.00             0.98
   sexual_chat            0.97             1.00
sexual_content            1.00             1.00
       suicide            0.92             0.98
      swearing            0.96             0.83
      violence            0.99             1.00
        weapon            0.90             0.96

To load this model, use the following command:

python
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

base_model = AutoModelForCausalLM.from_pretrained('Qwen/Qwen2.5-3B-Instruct', trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained('Qwen/Qwen2.5-3B-Instruct', trust_remote_code=True)
model = PeftModel.from_pretrained(base_model, 'raft-security-lab/harm-qwen-2.5-3b-lora-responses')