palette-lab/palette-k-14b
Palette-K-14B
한국 기업 문서 업무에 적응시킨 14B 모델 · A 14B model adapted for Korean enterprise document work · Apache-2.0 (base 라이선스 승계)
요약
Qwen2.5-14B-Instruct를 한국 기업 문서 과제(공문서·품의서 작성, 비즈니스 이메일 register, 정책 준수 판단, 공시 이해, 회의록→결정 추출)로 QLoRA 지도 미세조정한 모델.
PALETTE-BENCH-KO v0.2 (32문항) 기준 7개 모델 중 3위 — Naver·Kakao의 한국어 공개 모델과 2.3배 큰 Qwen2.5-32B를 상회하며, 자기 베이스 대비 +0.074. (전 모델을 수정된 채점 하네스로 재측정한 수치 — 이전 revision의 표는 이 표로 대체된다.)
이 모델은 1위가 아니다. 1위는 자매 모델 Palette-K-Midm(Mi:dm-2.0 최소 교란 적응)이며, 심사 모델 없는 결정적 패밀리만 보면 이 모델은 베이스와 동률(0.672)이다. 이득은 루브릭(LLM 심사) 패밀리에 집중된다. 전체 표와 해석은 LEADERBOARD 참조.
학습 방법
- 베이스: Qwen2.5-14B-Instruct (Apache-2.0)
- 방식: QLoRA (4-bit NF4), LoRA r=32 α=64, 전 projection 대상, 3 epoch, bf16 병합
- 데이터: 약 300건 — 공시 QA 120건(자체 생성 정답) + 작성/이메일/정책 180건 (gpt-4o 증류). 벤치마크와 해시 검증 완료 disjoint
- 연산: H100 1장, 학습 1회 약 $4
- 데이터 출처: 공개 데이터 파생 및 합성만 사용. 고객 데이터·크롤링 자료 미사용
알려진 한계
- 회의록→결정 추출이 약하다 (0.459). 전 모델 공통 난제(전 필드 0.213~0.582)이나 이 모델도 예외가 아니며, 합성 추출 학습 데이터를 추가하자 오히려 악화되어 제거했다(학습 이력 공개).
- 루브릭 편향 가능성 — 작성 계열 학습 타깃이 gpt-4o에서 증류되었고 평가 심사자도 gpt-4o다. 자기 유리 편향을 배제할 수 없어 심사 없는 지표를 별도 공개한다.
- 시드 규모 평가 (32문항). 방향성 지표이며 확정 순위가 아니다.
- 지도 미세조정만 수행 — 계속 사전학습·선호 최적화는 미수행.
사용
from transformers import AutoModelForCausalLM, AutoTokenizer
m = "imcapsule/palette-k-14b"
tok = AutoTokenizer.from_pretrained(m)
model = AutoModelForCausalLM.from_pretrained(m, torch_dtype="bfloat16", device_map="auto")
msgs = [{"role":"user","content":"다음 요청에 따라 한국어 품의서를 작성하라. ..."}]
ids = tok.apply_chat_template(msgs, return_tensors="pt", add_generation_prompt=True).to(model.device)
print(tok.decode(model.generate(ids, max_new_tokens=800, do_sample=False)[0][ids.shape[-1]:]))인용
@misc{palettek14b2026,
title = {Palette-K-14B: Korean Enterprise Document Adaptation of Qwen2.5-14B},
author = {Palette}, year = {2026},
note = {Apache-2.0; evaluated on PALETTE-BENCH-KO v0.2}
}English summary
A QLoRA supervised fine-tune of Qwen2.5-14B-Instruct for Korean enterprise document tasks. Ranks 3rd of 7 on PALETTE-BENCH-KO v0.2 (all models rescored under the corrected harness) — ahead of Naver's and Kakao's Korean open models and a 2.3× larger Qwen2.5-32B, +0.074 over its own base. It does not lead: our sibling model Palette-K-Midm (a minimal-perturbation adaptation of KT's Mi:dm-2.0) ranks 1st at 0.866, and on judge-free deterministic families this model only ties its base — the gains concentrate in LLM-judged families, and we report that rather than only the favourable aggregate. Training data is public-derived and synthetic only, hash-verified disjoint from the benchmark. See Known Limitations above.
