CoolFace
Modelpublic

morlayecis0003/nllb-200-pulaar-mairie

sourceHugging Faceupdated 7mo agoView on Hugging Face
0likes42downloads
Model Card

NLLB-200 Pulaar-Français (Domaine Administratif Sénégalais)

Ce modèle est une version fine-tunée de NLLB-200-distilled-600M spécialisée dans la traduction bidirectionnelle entre le Pulaar (Fuv_Latn) et le Français (Fra_Latn), spécifiquement pour le domaine de l'administration municipale au Sénégal.

Model Details

Model Description

Le but de ce modèle est d'aider les agents municipaux et les citoyens sénégalais à traduire des documents et des requêtes administratives (état civil, foncier, certificats de résidence). Le Pulaar est une langue à "faibles ressources", et ce modèle vise à réduire la fracture numérique.

  • —Développé par : Morlaye Cis (Master MIAGE / Mémoire de recherche)
  • —Type de modèle : Encoder-Decoder (Seq2Seq)
  • —Langues : Pulaar (Caractères latins) <-> Français
  • —Finetuned à partir de : facebook/nllb-200-distilled-600M

Uses

Direct Use

  • —Traduction de phrases liées à l'état civil (mariage, naissance, décès).
  • —Aide à la rédaction de demandes de certificats administratifs.
  • —Support pour les agents de mairie lors de l'accueil des usagers parlant Pulaar.

Out-of-Scope Use

  • —Traduction médicale complexe ou juridique de haut niveau.
  • —Textes littéraires ou poétiques (le modèle est optimisé pour le style administratif direct).

Bias, Risks, and Limitations

  • —Biais de domaine : Le modèle peut avoir tendance à traduire des phrases générales vers un contexte administratif.
  • —Limitation linguistique : Le modèle utilise principalement la variante du Pulaar parlée au Sénégal.
  • —Risques : Ne pas utiliser pour des décisions juridiques critiques sans vérification humaine.

How to Get Started with the Model

python
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer

model_id = "morlayecis0003/nllb-200-pulaar-mairie"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSeq2SeqLM.from_pretrained(model_id)

text = "So a waylii kominaa, potaa anndinde kominaa ɓooyɗo on."
inputs = tokenizer(text, return_tensors="pt")
translated_tokens = model.generate(
    **inputs, 
    forced_bos_token_id=tokenizer.convert_tokens_to_ids("fra_Latn"), 
    max_length=128
)
print(tokenizer.batch_decode(translated_tokens, skip_special_tokens=True)[0])