CoolFace
Modelpublic

WindstormLabs/origin-Helsinki-NLP-opus-mt-eo-caenes

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes6downloads
Model Card

Esperanto -> Catalan, English, Spanish MT Model

Model description

This repository contains a multilingual MarianMT model for Esperanto → (English, Spanish, Catalan) translation using language tags.

Usage

The model is loaded and used with transformers as:

python
from transformers import MarianMTModel, MarianTokenizer
import torch

model_name = "Helsinki-NLP/opus-mt-eo-caenes"

device = "cuda" if torch.cuda.is_available() else "cpu"
model = MarianMTModel.from_pretrained(model_name).to(device)
tokenizer = MarianTokenizer.from_pretrained(model_name)

source_texts = [
    ">>spa<< Saluton, kiel vi fartas?",
    ">>eng<< Saluton, kiel vi fartas?",
    ">>cat<< Saluton, kiel vi fartas?"
]

inputs = tokenizer(source_texts, return_tensors="pt", padding=True, truncation=True)
inputs = {k: v.to(device) for k, v in inputs.items()}

translated_ids = model.generate(inputs["input_ids"])
translated_texts = tokenizer.batch_decode(translated_ids, skip_special_tokens=True)

for src, tgt in zip(source_texts, translated_texts):
    print(f"Source: {src} => Translated: {tgt}")

Supported target languages (via tags)

You control the target language by prefixing the source sentence with one of the following tags:

  • —>>eng<< → English
  • —>>spa<< → Spanish
  • —>>cat<< → Catalan

Training data

The model was trained using Tatoeba parallel data, with FLORES-200 used as the development set.

Training sentence-pair counts:

  • —ca-eo: 672,931
  • —es-eo: 4,677,945
  • —eo-en: 5,000,000

Evaluation on FLORES

Language PairBLEUChrF++
epo-spa19.9849.11
epo-cat28.3555.42
epo-eng37.4763.09