ssgyejin/llama-3-Korean-Bllossom-8B-deobfuscation-KOTOX
012
ssgyejin/llama-3-Korean-Bllossom-8B-deobfuscation-KOTOX
MLP-KTLim/llama-3-Korean-Bllossom-8B 를 한국어 텍스트 난독화 복원(deobfuscation) 태스크로 파인튜닝한 LoRA 어댑터입니다. (전체 모델이 아니라 어댑터이므로 베이스 모델에 얹어서 사용합니다.)
- 학습 데이터셋: ssgyejin/KOTOX
- 논문: arXiv:2510.10961
사용법
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base_model = "MLP-KTLim/llama-3-Korean-Bllossom-8B"
adapter = "ssgyejin/llama-3-Korean-Bllossom-8B-deobfuscation-KOTOX"
tokenizer = AutoTokenizer.from_pretrained(adapter, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
base_model, torch_dtype=torch.bfloat16, device_map="auto", trust_remote_code=True,
)
model = PeftModel.from_pretrained(model, adapter) # LoRA 어댑터 결합
model.eval()
messages = [{"role": "user", "content": "여기에 난독화된 한국어 문장을 입력하세요"}]
inputs = tokenizer.apply_chat_template(
messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
out = model.generate(inputs, max_new_tokens=512, do_sample=False)
print(tokenizer.decode(out[0][inputs.shape[-1]:], skip_special_tokens=True))추론 속도가 중요하면 model = model.merge_and_unload() 로 어댑터를 병합해 사용할 수 있습니다.
학습 정보
- Base model:
MLP-KTLim/llama-3-Korean-Bllossom-8B - Dataset: ssgyejin/KOTOX
- Method: LoRA (PEFT, r=64, alpha=16, dropout=0.1)
- Seed: 42
- Task: Korean text deobfuscation
- Paper: arXiv:2510.10961
