2ADT-Consulting/nllb-susu-v1
010
NLLB-Susu v1 — Traducteur Soussou ↔ Français / Anglais
Modèle de traduction pour le soussou (susu/sosso, code ISO sus), langue de Guinée. Fine-tuning de NLLB-200-distilled-600M avec ajout d'un nouveau token de langue sus_Latn (le soussou n'étant pas couvert par NLLB de base).
4 directions dans un seul modèle : fr↔sus, en↔sus.
Scores (chrF++ sur jeu de dev)
Utilisation
import torch
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("2ADT-Consulting/nllb-susu-v1")
model = AutoModelForSeq2SeqLM.from_pretrained("2ADT-Consulting/nllb-susu-v1")
def translate(text, src_lang, tgt_lang):
tok.src_lang = src_lang
inputs = tok(text, return_tensors="pt")
gen = model.generate(
**inputs,
forced_bos_token_id=tok.convert_tokens_to_ids(tgt_lang),
max_length=128, num_beams=4, no_repeat_ngram_size=3,
)
return tok.batch_decode(gen, skip_special_tokens=True)[0]
# codes : sus_Latn (soussou), fra_Latn (français), eng_Latn (anglais)
print(translate("Je vais au marché.", "fra_Latn", "sus_Latn"))
print(translate("A fɔlɛ ra, Ala naxa koore nun bɔxi daa.", "sus_Latn", "fra_Latn"))Données d'entraînement
Corpus parallèle issu de traductions bibliques (soussou en écriture latine ↔ français/anglais), via YouVersion.
Limitations
- Biais de registre : le corpus étant biblique, le modèle emploie parfois un vocabulaire religieux là où on attendrait un registre courant.
- Pas encore validé par un locuteur natif.
- Voir la v2 (
2ADT-Consulting/nllb-susu-v2) qui ajoute un lexique du quotidien, des dialogues, et la compréhension de l'écriture « à la française ».
Licence
CC-BY-NC-4.0 (héritée de NLLB-200). Données dérivées de traductions bibliques — usage non commercial ; vérifier les conditions de la source avant redistribution.
