CoolFace
Modelpublic

Mun2/qwen3.5-9b-korean-essay-scorer-vllm

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes31downloads
Model Card

Qwen3.5-9B Korean Essay Scorer - vLLM Submission

한국어 논증적 글의 content, organization, expression 점수와 한국어 근거를 JSON으로 생성하는 대회 제출용 모델입니다. Qwen3.5-9B 전체 가중치에 생성형 GRPO LoRA를 병합했으며, 별도 adapter, 커스텀 Python 코드 또는 인증 토큰 없이 표준 Transformers와 vLLM에서 로드됩니다.

출력 형식

json
{
  "content": {"score": 4, "rationale": "내용 판단 근거"},
  "organization": {"score": 3, "rationale": "구성 판단 근거"},
  "expression": {"score": 4, "rationale": "표현 판단 근거"}
}

점수는 각 영역의 1~5 정수입니다. 모델은 대회 공식 시스템 프롬프트와 [prompt_text]/[essay_text] 형식의 사용자 입력을 전제로 학습됐습니다.

검증 결과

공개 validation 400건, temperature 0, seed 42 조건의 개발 모니터 결과입니다.

지표결과
유효 JSON390 / 400 (97.5%)
Macro integer RMSE0.95881
Macro integer Spearman0.44608

지표는 유효 JSON 390건에서 계산됐습니다. 운영 측 비공개 test 또는 공식 순위 점수가 아닙니다.

모델 구성

  • —Base: Qwen/Qwen3.5-9B
  • —Base revision: 21eca8a083a2121a92fba681f4a7c72cf20ff1a7
  • —Training: GRPO 20 steps, train 2,000건, seed 42
  • —LoRA: rank 32, alpha 64, dropout 0.05
  • —Weights: LoRA가 병합된 FP16 전체 가중치
  • —Context length: 4,096 tokens
  • —Chat template: thinking block을 닫고 JSON만 생성하는 고정 템플릿

vLLM 실행

bash
vllm serve Mun2/qwen3.5-9b-korean-essay-scorer-vllm \
  --host 0.0.0.0 \
  --port 8000 \
  --dtype bfloat16 \
  --max-model-len 4096 \
  --language-model-only

모델 저장소 자체의 config.json, tokenizer 및 chat template만으로도 로드되며, --language-model-only는 텍스트 평가에서 비전 인코더 프로파일링을 생략하기 위한 선택 사항입니다.

제한 사항

  • —포맷 실패가 완전히 제거되지는 않았으며 validation에서 2.5%였습니다.
  • —점수·근거는 자동 평가 보조용이며 고위험 의사결정에 단독으로 사용하지 마십시오.
  • —학습 데이터와 validation 원문 및 예측 결과는 이 저장소에 포함하지 않습니다.