MelissaJ/koelectra-emotion-6-emotion-base
0868
KoELECTRA Emotion Classification (기쁨/분노/상처/불안/당황/슬픔)
모델 개요
이 모델은 KoELECTRA-base-v3를 기반으로 파인튜닝된 한국어 감정 분류 모델입니다. 입력 문장을 6가지 감정 범주 중 하나로 분류합니다:
- 기쁨
- 분노
- 상처
- 불안
- 당황
- 슬픔
학습 데이터
- 감성 대화 말뭉치 (Korean Emotional Conversation Corpus, AI Hub) 한국지능정보사회진흥원(NIA)에서 구축한 대화 기반 감정 레이블 데이터셋
- 데이터셋 출처: AI Hub 감성 대화 말뭉치
- 클래스 분포:
- 불안: 9,320
- 분노: 9,160
- 상처: 9,143
- 슬픔: 9,125
- 당황: 8,756
- 기쁨: 6,126
학습 설정
- Epoch: 100 (최적 성능은 2~3 epoch 구간에서 관측)
- Optimizer: AdamW
- Learning rate: 5e-5
- Batch size: train 32 / eval 64
- Weight decay: 0.01
- Mixed precision: FP16 (GPU)
성능
Validation set 기준:
- 최고 성능 (F1 Macro ≈ 0.5968): Epoch 3
- 이후 epoch에서는 Validation Loss가 급격히 증가 → 과적합 경향
사용법
from transformers import pipeline
pipe = pipeline("text-classification", model="MelissaJ/koelectra-emotion-6-emotion-base")
text = "그런일이 있으셨다니 매우 슬프시겠어요"
print(pipe(text))
# [{'label': '슬픔', 'score': 0.8857910633087158}]