CoolFace
Modelpublic

tartuNLP/Llama-3.1-EstLLM-70B-0826

sourceHugging Facellama3.1updated 1mo agoView on Hugging Face
0likes188downloads
Model Card

[image]

Llama EstLLM 70B 0826 Base

Please note that this is a base text completion model that has not been instruction-tuned. It is intended for fine-tuning on downstream tasks rather than direct use for chat or instruction-following.

meta-llama/Llama-3.1-70B continuously pre-trained on approximately 60B tokens.

Model Details

Model Description

  • —Developed by: TartuNLP and TalTechNLP research groups
  • —Funded by: Estonian Ministry of Education and Research, “Estonian Language Technology Program 2018-2027”
  • —Model type: Causal Language Model
  • —Language(s) (NLP): Estonian, English
  • —License: Llama 3.1 Community License Agreement
  • —Finetuned from model: meta-llama/Llama-3.1-70B

Logits-based

Estonian

Model (# parameters ↓)belebele-etexam-etgrammar-etinflection-ettrivia-etwinogrande-etxcopa-etGlobalPIQA-et
Qwen/Qwen2.5-72B**0.8944**-0.80800.61770.34630.65700.67200.6000
meta-llama/Llama-3.1-70B0.8980.7390.7850.8750.4210.7420.6680.66
tartuNLP/Llama-3.1-EstLLM-70B-08260.8042-**0.8910**0.92580.50000.80420.77400.80
google/gemma-3-27b-pt0.8989-0.9140**0.8821**0.39000.77020.800.70
utter-project/EuroLLM-22B-25120.8133-*0.9030**0.6186**0.4238**-**0.79**-
google/gemma-3-12b-pt0.8722-0.85100.79050.3275-0.7720-
utter-project/EuroLLM-9B0.6990.6180.6630.440.3710.6920.7120.69
Qwen/Qwen3-8B-Base0.8067-0.72200.51880.30130.59480.58600.56
mistralai/Ministral-3-8B-Base-25120.2630.5280.6410.5850.3160.6230.560.6
swiss-ai/Apertus-8B-25090.7680.6070.7890.4780.3290.7110.6780.73
meta-llama/Llama-3.1-8B0.670.4470.6580.5870.30.5960.5320.53
tartuNLP/Apertus-EstLLM-8B-11250.7880.6360.8340.5230.3890.7520.730.79
tartuNLP/Llama-3.1-EstLLM-8B-05250.7720.570.8750.6190.4490.740.7520.78
Llammas-base0.3870.4620.5380.2690.3360.6970.6860.76
BSC-LT/salamandra-7b0.4480.5050.6990.2680.2960.6730.6580.71
Qwen/Qwen2.5-7B0.6640.4550.6540.4520.290.530.4940.54

English

Model (# parameters ↓)belebele-enMMLU-Reduxwinogrande
Qwen/Qwen2.5-72B0.9589-0.7822
meta-llama/Llama-3.1-70B**0.95**-0.837
tartuNLP/Llama-3.1-EstLLM-70B-08260.9278-**0.7987**
google/gemma-3-27b-pt0.9411-0.7845
utter-project/EuroLLM-9B0.7730.5570.732
Qwen/Qwen3-8B-Base0.9378-0.7206
mistralai/Ministral-3-8B-Base-25120.8970.7290.771
swiss-ai/Apertus-8B-25090.8270.5980.761
meta-llama/Llama-3.1-8B0.8730.6490.785
tartuNLP/Apertus-EstLLM-8B-11250.8430.6250.763
tartuNLP/Llama-3.1-EstLLM-8B-05250.870.6270.766
tartuNLP/Llammas-base0.450.350.72
BSC-LT/salamandra-7b0.5310.4490.706
Qwen/Qwen2.5-7B0.9120.750.751

Translation

Model (# parameters ↓)flores en→et (BLEU)flores et→en (BLEU)
Qwen/Qwen2.5-72B8.577623.82
meta-llama/Llama-3.1-70B2439.6
tartuNLP/Llama-3.1-EstLLM-70B-082629.73**41.06**
google/gemma-3-27b-pt15.9825.87
utter-project/EuroLLM-22B-251219.8922.33
google/gemma-3-12b-pt11.1121.21
utter-project/EuroLLM-9B**29.0**41.2
mistralai/Ministral-3-8B-Base-251212.629.6
swiss-ai/Apertus-8B-250925.038.5
meta-llama/Llama-3.1-8B13.533.7
tartuNLP/Apertus-EstLLM-8B-112527.437.4
tartuNLP/Llama-3.1-EstLLM-8B-052528.136.8
Qwen/Qwen3-8B-Base5.620.28
tartuNLP/Llammas-base22.032.7
BSC-LT/salamandra-7b14.718.2
Qwen/Qwen2.5-7B5.127.5

Limitations

TODO

Citation

@misc{dorkin2026estllmenhancingestoniancapabilities,
      title={{EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training}}, 
      author={Aleksei Dorkin and Taido Purason and Emil Kalbaliyev and Hele-Andra Kuulmets and Marii Ojastu and Mark Fišel and Tanel Alumäe and Eleri Aedmaa and Krister Kruusmaa and Kairit Sirts},
      year={2026},
      eprint={2603.02041},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2603.02041}, 
}