CoolFace
Modelpublic

ssgyejin/llama-3-Korean-Bllossom-8B-deobfuscation-KOTOX

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes12downloads
Model Card

ssgyejin/llama-3-Korean-Bllossom-8B-deobfuscation-KOTOX

MLP-KTLim/llama-3-Korean-Bllossom-8B 를 한국어 텍스트 난독화 복원(deobfuscation) 태스크로 파인튜닝한 LoRA 어댑터입니다. (전체 모델이 아니라 어댑터이므로 베이스 모델에 얹어서 사용합니다.)

사용법

python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

base_model = "MLP-KTLim/llama-3-Korean-Bllossom-8B"
adapter = "ssgyejin/llama-3-Korean-Bllossom-8B-deobfuscation-KOTOX"

tokenizer = AutoTokenizer.from_pretrained(adapter, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    base_model, torch_dtype=torch.bfloat16, device_map="auto", trust_remote_code=True,
)
model = PeftModel.from_pretrained(model, adapter)  # LoRA 어댑터 결합
model.eval()

messages = [{"role": "user", "content": "여기에 난독화된 한국어 문장을 입력하세요"}]
inputs = tokenizer.apply_chat_template(
    messages, add_generation_prompt=True, return_tensors="pt"
).to(model.device)
out = model.generate(inputs, max_new_tokens=512, do_sample=False)
print(tokenizer.decode(out[0][inputs.shape[-1]:], skip_special_tokens=True))

추론 속도가 중요하면 model = model.merge_and_unload() 로 어댑터를 병합해 사용할 수 있습니다.

학습 정보

  • —Base model: MLP-KTLim/llama-3-Korean-Bllossom-8B
  • —Dataset: ssgyejin/KOTOX
  • —Method: LoRA (PEFT, r=64, alpha=16, dropout=0.1)
  • —Seed: 42
  • —Task: Korean text deobfuscation
  • —Paper: arXiv:2510.10961