CoolFace
Modelpublic

TartarusXXX/synthetic-n2en-marian-transformers

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes7downloads
Model Card

synthetic-n2en-marian-transformers

This repository contains a Marian NMT checkpoint packaged in OPUS-MT style.

Model Details

  • —Source language: multi (Multilingual)
  • —Target language: en (English)
  • —Task: translation
  • —Framework: Marian NMT
  • —Training data: TartarusXXX/synthetic-parallel-16lang-1-4m-gemini-3-1-flash-lite
  • —Validation set: bouquet-dev-n2en

Evaluation target languages: tr, kmr, de, es, fr, el, bg, ru, ka, hy, fa, ckb, ur, ar

Validation

  • —Best bleu: 28.8111
  • —Epoch: 9
  • —Update: 318000
  • —Timestamp: 2026-06-17 05:14:00
  • —Validation set: bouquet-dev-n2en

Raw best line:

text
[2026-06-17 05:14:00] [valid] Ep. 9 : Up. 318000 : bleu : 28.8111 : new best

Recent validation results:

TimestampEpochUpdateMetricScoreStatus
2026-06-17 03:29:328291500bleu28.5341stalled 2 times (last best: 28.6381)
2026-06-17 05:14:009318000bleu28.8111new best
2026-06-17 06:58:3610344500bleu28.621stalled 1 times (last best: 28.8111)
2026-06-17 08:41:4910371000bleu28.5135stalled 2 times (last best: 28.8111)
2026-06-17 10:26:1411397500bleu26.9018stalled 3 times (last best: 28.8111)
2026-06-17 12:10:5012424000bleu27.974stalled 4 times (last best: 28.8111)
2026-06-17 13:54:1012450500bleu27.0804stalled 5 times (last best: 28.8111)
2026-06-17 15:38:4513477000bleu27.3126stalled 6 times (last best: 28.8111)
2026-06-17 17:23:1914503500bleu27.4481stalled 7 times (last best: 28.8111)
2026-06-17 19:06:4514530000bleu26.43stalled 8 times (last best: 28.8111)
2026-06-17 20:51:2415556500bleu26.6759stalled 9 times (last best: 28.8111)
2026-06-17 22:36:1116583000bleu26.0265stalled 10 times (last best: 28.8111)

Files

  • —synthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.model1.npz.best-bleu.npz
  • —synthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.vocab.yml
  • —opus.trg.spm32k-model
  • —opus.src.spm32k-model
  • —hf-csv-synthetic.n2en.bouquet.transformer.mk
  • —synthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.model1.npz.yml
  • —synthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.train1.log
  • —synthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.valid1.log
  • —bouquet-dev-n2en.best-bleu.validation-style-spm.tsv
  • —bouquet-dev-n2en.best-bleu.validation-style-spm.md
  • —best-bleu.decoder.yml
  • —translate_with_marian.py

Usage

Install Marian and run:

bash
python translate_with_marian.py --decoder best-bleu.decoder.yml < input.txt > output.txt

The decoder YAML uses paths relative to this repository.

Conversion

Converted from the Marian checkpoint in TartarusXXX/synthetic-n2en-marian using the Transformers Marian converter.

  • —Source language: multi
  • —Target languages: en

Transformers Usage

python
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer

model_name = "TartarusXXX/synthetic-n2en-marian-transformers"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)

# This model was trained as `multi` -> `en`.
# If the Marian training data uses target-language tags, include the desired
# target tag in the source sentence, following the training convention.
inputs = tokenizer("Hello world!", return_tensors="pt")
outputs = model.generate(**inputs)
print(tokenizer.batch_decode(outputs, skip_special_tokens=True)[0])