CoolFace
Modelpublic

tartuNLP/Llama-3.1-EstLLM-8B-0525

sourceHugging Facellama3.1updated 1mo agoView on Hugging Face
0likes168downloads
Model Card

[image]

Llama EstLLM 8B 0825 Base

Please note that this is a base text completion model that has not been instruction-tuned. It is intended for fine-tuning on downstream tasks rather than direct use for chat or instruction-following.

meta-llama/Llama-3.1-8B continuously pre-trained on approximately 35B tokens. Continued pre-training was performed for a single epoch on:

  • —Estonian National Corpus (8.6B tokens)
  • —Python-Edu (3.3B tokens)
  • —FineMath4-Plus (9.5B tokens)
  • —General Instruction-Augmented Corpora (7.4B tokens)
  • —Cosmopedia v2 (6.9B tokens)

Model Details

Model Description

  • —Developed by: TartuNLP and TalTechNLP research groups
  • —Funded by: Estonian Ministry of Education and Research, “Estonian Language Technology Program 2018-2027”
  • —Model type: Causal Language Model
  • —Language(s) (NLP): Estonian, English
  • —License: Llama 3.1 Community License Agreement
  • —Finetuned from model: meta-llama/Llama-3.1-8B

Evaluation

Logits-based

Estonian

Model (# parameters ↓)belebele-etexam-etgrammar-etinflection-ettrivia-etwinogrande-etxcopa-etGlobalPIQA-et
utter-project/EuroLLM-9B0.699**0.618**0.6630.440.3710.6920.7120.69
mistralai/Ministral-3-8B-Base-25120.2630.5280.6410.5850.3160.6230.560.6
swiss-ai/Apertus-8B-25090.7680.6070.7890.4780.3290.7110.6780.73
meta-llama/Llama-3.1-8B0.670.4470.658**0.587**0.30.5960.5320.53
tartuNLP/Apertus-EstLLM-8B-11250.7880.636**0.834**0.523**0.389**0.752**0.73**0.79
tartuNLP/Llama-3.1-EstLLM-8B-0525**0.772**0.570.8750.6190.449**0.74**0.752**0.78**
Llammas-base0.3870.4620.5380.2690.3360.6970.6860.76
BSC-LT/salamandra-7b0.4480.5050.6990.2680.2960.6730.6580.71
Qwen/Qwen2.5-7B0.6640.4550.6540.4520.290.530.4940.54

English

Model (# parameters ↓)belebele-enMMLU-Reduxwinogrande
utter-project/EuroLLM-9B0.7730.5570.732
mistralai/Ministral-3-8B-Base-25120.897**0.729****0.771**
swiss-ai/Apertus-8B-25090.8270.5980.761
meta-llama/Llama-3.1-8B**0.873**0.6490.785
tartuNLP/Apertus-EstLLM-8B-11250.8430.6250.763
tartuNLP/Llama-3.1-EstLLM-8B-05250.870.6270.766
tartuNLP/Llammas-base0.450.350.72
BSC-LT/salamandra-7b0.5310.4490.706
Qwen/Qwen2.5-7B0.9120.750.751

Translation

Model (# parameters ↓)flores en→et (BLEU)flores et→en (BLEU)
utter-project/EuroLLM-9B29.041.2
mistralai/Ministral-3-8B-Base-251212.629.6
swiss-ai/Apertus-8B-250925.0**38.5**
meta-llama/Llama-3.1-8B13.533.7
tartuNLP/Apertus-EstLLM-8B-112527.437.4
tartuNLP/Llama-3.1-EstLLM-8B-0525**28.1**36.8
tartuNLP/Llammas-base22.032.7
BSC-LT/salamandra-7b14.718.2
Qwen/Qwen2.5-7B5.127.5

Limitations

In addition to the limitations of the original Llama 3.1 8B model, this model has the following:

  • —Somewhat limited context size due to the continued training being done with the sequence length of 4096 tokens.

Citation

@misc{dorkin2026estllmenhancingestoniancapabilities,
      title={{EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training}}, 
      author={Aleksei Dorkin and Taido Purason and Emil Kalbaliyev and Hele-Andra Kuulmets and Marii Ojastu and Mark Fišel and Tanel Alumäe and Eleri Aedmaa and Krister Kruusmaa and Kairit Sirts},
      year={2026},
      eprint={2603.02041},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2603.02041}, 
}