TartarusXXX/synthetic-n2en-marian-transformers
07
synthetic-n2en-marian-transformers
This repository contains a Marian NMT checkpoint packaged in OPUS-MT style.
Model Details
- Source language:
multi(Multilingual) - Target language:
en(English) - Task: translation
- Framework: Marian NMT
- Training data:
TartarusXXX/synthetic-parallel-16lang-1-4m-gemini-3-1-flash-lite - Validation set:
bouquet-dev-n2en
Evaluation target languages: tr, kmr, de, es, fr, el, bg, ru, ka, hy, fa, ckb, ur, ar
Validation
- Best
bleu:28.8111 - Epoch:
9 - Update:
318000 - Timestamp:
2026-06-17 05:14:00 - Validation set:
bouquet-dev-n2en
Raw best line:
[2026-06-17 05:14:00] [valid] Ep. 9 : Up. 318000 : bleu : 28.8111 : new bestRecent validation results:
Files
synthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.model1.npz.best-bleu.npzsynthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.vocab.ymlopus.trg.spm32k-modelopus.src.spm32k-modelhf-csv-synthetic.n2en.bouquet.transformer.mksynthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.model1.npz.ymlsynthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.train1.logsynthetic_parallel_16lang_1_4m_gemini_3_1_flash_lite.spm32k-spm32k.transformer.valid1.logbouquet-dev-n2en.best-bleu.validation-style-spm.tsvbouquet-dev-n2en.best-bleu.validation-style-spm.mdbest-bleu.decoder.ymltranslate_with_marian.py
Usage
Install Marian and run:
python translate_with_marian.py --decoder best-bleu.decoder.yml < input.txt > output.txtThe decoder YAML uses paths relative to this repository.
Conversion
Converted from the Marian checkpoint in TartarusXXX/synthetic-n2en-marian using the Transformers Marian converter.
- Source language:
multi - Target languages:
en
Transformers Usage
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
model_name = "TartarusXXX/synthetic-n2en-marian-transformers"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
# This model was trained as `multi` -> `en`.
# If the Marian training data uses target-language tags, include the desired
# target tag in the source sentence, following the training convention.
inputs = tokenizer("Hello world!", return_tensors="pt")
outputs = model.generate(**inputs)
print(tokenizer.batch_decode(outputs, skip_special_tokens=True)[0])