team-lucid/deberta-v3-xlarge-korean
8405
deberta-v3-xlarge-korean
Model Details
DeBERTa는 Disentangled Attention과 Enhanced Masked Language Model을 통해 BERT의 성능을 향상시킨 모델입니다. 그중 DeBERTa V3은 ELECTRA-Style Pre-Training에 Gradient-Disentangled Embedding Sharing을 적용하여 DeBERTA를 개선했습니다.
이 연구는 구글의 TPU Research Cloud(TRC)를 통해 지원받은 Cloud TPU로 학습되었습니다.
How to Get Started with the Model
from transformers import AutoTokenizer, DebertaV2ForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("team-lucid/deberta-v3-xlarge-korean")
model = DebertaV2ForSequenceClassification.from_pretrained("team-lucid/deberta-v3-xlarge-korean")
inputs = tokenizer("안녕, 세상!", return_tensors="pt")
outputs = model(**inputs)Evaluation
\* 다른 모델의 결과는 KcBERT-Finetune 과 KoELECTRA를 참고했으며, Hyperparameter 역시 다른 모델과 유사하게 설정습니다.
