CoolFace
Modelpublic

pprokopidis/elNER18-bert-base-greek-uncased-v1-bs8-e150-lr5e-06

sourceHugging Facecc-by-nc-2.0updated 1y agoView on Hugging Face
0likes7downloads
Model Card

Greek Named Entity Model finetuned on the elNER Dataset

This Greek NER model was fine-tuned by researchers at the Institute for Language and Speech Processing/Athena RC. The model was finetuned on the elNER-18 dataset using the nlpaueb/bert-base-greek-uncased-v1 as backbone LM.

Dataset

The elNER-18 dataset consists of 21K sentences, 623K tokens and 94K annotated named entities for 18 NE classes.

The following 18 named entities are annotated in the train partition:

Class#
ORG10944
PERSON8774
CARDINAL7343
GPE6781
DATE6338
ORDINAL1438
PERCENT1437
LOC1404
NORP1396
MONEY1012
TIME1011
EVENT962
PRODUCT668
WORKOFART608
FAC567
QUANTITY565
LAW235
LANGUAGE55

Fine-Tuning

Flair version 0.14 was used for fine-tuning.

<!-- A hyper-parameter search is to be performed. Right now we have results with the following parameters. --> The model was trained with the following hyper-parameters:

  • —Batch Size: [8]
  • —Learning Rate: [5e-05]

Results

  • —F-score (micro) 0.9173
  • —F-score (macro) 0.8778
  • —Accuracy 0.8651
Classprecisionrecallf1-scoresupport
ORG0.89310.88470.88891388
PERSON0.95160.97240.96191051
CARDINAL0.93300.96270.9476911
DATE0.94030.94030.9403838
GPE0.92820.95520.9415826
PERCENT0.98070.98540.9831206
LOC0.80110.79210.7966178
ORDINAL0.94770.94770.9477172
NORP0.86900.89360.8811141
TIME0.89510.93430.9143137
EVENT0.63950.72310.6787130
MONEY0.98180.97300.9774111
PRODUCT0.78820.80720.797683
WORKOFART0.83130.82140.826384
FAC0.69330.67530.684277
QUANTITY0.86360.87690.870265
LAW0.82140.82140.821428
LANGUAGE1.00000.88890.94129
micro avg0.91120.92350.91736435
macro avg0.87550.88090.87786435
weighted avg0.91160.92350.91746435

Files

The Flair training log has also been uploaded to the model hub.

Example usage

python
#! pip install flair
#! pip install segtok
from flair.models import SequenceTagger
from flair.data import Sentence
tagger = SequenceTagger.load("pprokopidis/elNER18-bert-base-greek-uncased-v1-bs8-e150-lr5e-06")
text = """Η Ρωσία απέκλεισε τη δυνατότητα διεξαγωγής συνομιλιών για τα πυρηνικά όπλα με τις Ηνωμένες Πολιτείες, επικαλούμενη τη στάση της Ουάσινγκτον στο θέμα της επέκτασης του ΝΑΤΟ, δήλωσε σήμερα η εκπρόσωπος του ρωσικού υπουργείου Εξωτερικών Μαρία Ζαχάροβα.
«Δεν βλέπουμε κανένα νόημα στον διάλογο με την Ουάσινγκτον χωρίς τον σεβασμό των θεμελιωδών συμφερόντων της Ρωσίας. Πρώτα απ’ όλα, πρόκειται για το πρόβλημα της επέκτασης του ΝΑΤΟ στον μετασοβιετικό χώρο, το οποίο δημιουργεί απειλές για την κοινή ασφάλεια», δήλωσε η Ζαχάροβα.
Ο Τζιμ Τζάρμους (αγγλικά: Jim Jarmusch, 22 Ιανουαρίου 1953) είναι Αμερικανός σκηνοθέτης, γνωστός κυρίως για τις ταινίες Πέρα από τον Παράδεισο (1984), Στην παγίδα του νόμου (1986), Καφές και τσιγάρα (1993), Ο Νεκρός (1995) και Τσακισμένα λουλούδια (2005). Θεωρείται εκπρόσωπος του ανεξάρτητου αμερικανικού κινηματογράφου και μέσα από τις ταινίες του εκφράζονται και ορισμένες από τις αριστερές πολιτικές του πεποιθήσεις.
"""
# use a library to split into sentences
from segtok.segmenter import split_single
sentences = [Sentence(sent, use_tokenizer=True) for sent in split_single(text) if sent.strip()]
tagger.predict(sentences)
for sentence in sentences:
    print(sentence)
    for span in sentence.get_spans():
        print(span)