internetov1488/qwen3-4b-abliterated
0766
Qwen3-4B Abliterated
Uncensored version of Qwen3-4B, ablated with Heretic by internetov.
Model Details
- Base model: Qwen/Qwen3-4B
- Method: Heretic (LoRA abliteration)
- Author: internetov
- License: Apache 2.0
Results
- Refusals: 4/100 (baseline 99/100)
- KL divergence: 0.0010
- Abliterable components:
attn.o_proj,mlp.down_proj(36 layers each)
What's Different
- 96% of refusals removed
- Original capabilities preserved (very low KL divergence)
- No system-prompt dependence for uncensored behavior
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "internetov1488/qwen3-4b-abliterated"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16, device_map="auto")
messages = [{"role": "user", "content": "Привет, как дела?"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt", return_dict=False).to("cuda")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0][inputs.shape[1]:], skip_special_tokens=True))