CoolFace
Modelpublic

internetov1488/qwen3-4b-abliterated

sourceHugging Faceapache-2.0updated 11d agoView on Hugging Face
0likes766downloads
Model Card

Qwen3-4B Abliterated

Uncensored version of Qwen3-4B, ablated with Heretic by internetov.

Model Details

  • —Base model: Qwen/Qwen3-4B
  • —Method: Heretic (LoRA abliteration)
  • —Author: internetov
  • —License: Apache 2.0

Results

  • —Refusals: 4/100 (baseline 99/100)
  • —KL divergence: 0.0010
  • —Abliterable components: attn.o_proj, mlp.down_proj (36 layers each)

What's Different

  • —96% of refusals removed
  • —Original capabilities preserved (very low KL divergence)
  • —No system-prompt dependence for uncensored behavior

Usage

python
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "internetov1488/qwen3-4b-abliterated"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")

messages = [{"role": "user", "content": "Привет, как дела?"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt", return_dict=False).to("cuda")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0][inputs.shape[1]:], skip_special_tokens=True))