smllms/HyperCLOVA-X-SEED-MISHULTA-SolarFree-v1.0
HyperCLOVA-X-SEED-MISHULTA-SolarFree-v1.0
K-DATA SCIENCE 해커톤 제출 모델(Solar-free 변형) · 팀 MISHULTA
naver-hyperclovax/HyperCLOVAX-SEED-Think-14B(국내 기업 개발 모델, 14.8B)를 한국어 객관식 추론 과제에 맞춰 QLoRA로 미세조정한 뒤 병합한 모델입니다. 같은 팀의 1위 제출 smllms/HyperCLOVA-X-SEED-MISHULTA-Solar-Distilled-v1.9와 동일한 레시피(completion-only loss · completion 길이 상한 1,280 · 종료 토큰 학습 · 채팅 템플릿 기본 think-OFF)를 쓰되, Upstage Solar Pro 4로 생성한 데이터를 전량 제외하고 AI Hub·공개 train 셋·자기생성(self-STaR)·DeepSeek-R1 교사 데이터만으로 학습했습니다. 외부 상용 LLM 산출물 의존 없이 어디까지 도달하는지를 같은 조건에서 비교하기 위한 모델입니다.
학습 데이터 (usable 14,435 예제 · 1 epoch · 903 step · A6000 1장 약 4.3시간)
모두 공개 데이터 또는 자체 생성 데이터이며, 평가용 test 스플릿은 사용하지 않았습니다. Solar 계열 산출물 0건.
정규화(clean_cot: think 태그 제거·반복 정답 축약·끝맺음 보정)는 v1.9와 동일. 평가 벤치마크(KMMLU-Pro·CLIcK·Ko-MuSR)와의 문항 중복은 문항 + 선택지 단위로 대조해 제거했습니다(정확 일치 범위).
사용법
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "smllms/HyperCLOVA-X-SEED-MISHULTA-SolarFree-v1.0"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, dtype=torch.bfloat16, device_map="auto")
messages = [{"role": "user", "content": "다음 문제의 정답을 고르시오. 마지막 줄에 \"정답: X\" 형식으로 답하시오.\n\n..."}]
inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(inputs, do_sample=False, stop_strings=["<|endofturn|>", "<|stop|>"], tokenizer=tok)
print(tok.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))채팅 템플릿 기본값은 think-OFF(<|im_start|>assistant/think\n<|im_end|> 후 바로 답변)입니다. 사고 과정을 켜려면 force_reasoning=True.
라이선스
베이스 모델 라이선스(HyperCLOVA X SEED)를 따릅니다. 학습 데이터 출처는 위 표와 같으며 Solar 계열 데이터는 포함되지 않습니다.
