CoolFace
Modelpublic

nikitast/multilang-classifier-roberta

sourceHugging Faceupdated 4y agoView on Hugging Face
3likes13downloads
Model Card

RoBERTa for Multilabel Language Classification

Training

RoBERTa fine-tuned on small parts of Open Subtitles, Oscar and Tatoeba datasets (~9k samples per language).

Implemented heuristic algorithm for multilingual training data creation - https://github.com/n1kstep/lang-classifier

data sourcelanguage
open_subtitleska, he, en, de
oscarbe, kk, az, hu
tatoebaru, uk

Validation

The metrics obtained from validation on the another part of dataset (~1k samples per language).

Training LossValidation LossF1-ScoreRoc AucAccuracySupport
0.1615000.1109490.9478440.9539390.76206326858