chlgks/emour-emotion-kcelectra
128
emour-emotion-kcelectra
한국어 대화 감정 분류 (15종) — 문장 단위 모델. 커플 메신저 서비스 Emour 의 1차 모델이며, 아래 두 맥락 모델의 warm-start 시작점입니다.
🔎 새로 쓰신다면 [`emour-emotion-kcelectra-context-v2`](https://huggingface.co/chlgks/emour-emotion-kcelectra-context-v2) 를 쓰십시오. 이 모델은 문장 하나만 보기 때문에"됐어""괜찮아"처럼 맥락에 따라 의미가 달라지는 말을 구분하지 못합니다. 이 저장소는 비교 기준(baseline)으로서의 가치 때문에 남겨둡니다 — 뒤의 맥락 모델을 평가할 때 우리가 만든 데이터를 전혀 학습하지 않은 모델이 필요했고, 그 역할을 이 모델이 했습니다.
사용법
문장 하나만 넣습니다.
from transformers import pipeline
clf = pipeline("text-classification", model="chlgks/emour-emotion-kcelectra")
print(clf("오늘 진짜 고마웠어")) # [{'label': '고마움', ...}]라벨 (15종)
일반적인 감정 분류에 '관계 신호' 축을 추가로 설계했습니다. 커플 대화에서는 감정의 긍부정보다 상대에게 무엇을 전하려는 발화인지가 더 중요한 경우가 많기 때문입니다.
학습
성능 — 그리고 이 모델이 남긴 교훈
0.73을 보고 배포했는데 실사용에서 0.175로 무너졌습니다.
여기서 두 가지를 동시에 확인했습니다.
- 문장 단위 모델이라 맥락을 읽지 못합니다.
- 0.73이라는 숫자 자체가 실제 사용 환경을 전혀 반영하지 못한 지표였습니다.
두 번째가 더 중요했습니다. 모델을 고치기 전에 평가 방식을 고쳐야 했습니다. 이 판단에서 맥락 모델이 나왔습니다.
계보
라이선스
MIT. base 모델 `beomi/KcELECTRA-base`(MIT)를 따릅니다.
