morlayecis0003/nllb-200-pulaar-mairie
042
NLLB-200 Pulaar-Français (Domaine Administratif Sénégalais)
Ce modèle est une version fine-tunée de NLLB-200-distilled-600M spécialisée dans la traduction bidirectionnelle entre le Pulaar (Fuv_Latn) et le Français (Fra_Latn), spécifiquement pour le domaine de l'administration municipale au Sénégal.
Model Details
Model Description
Le but de ce modèle est d'aider les agents municipaux et les citoyens sénégalais à traduire des documents et des requêtes administratives (état civil, foncier, certificats de résidence). Le Pulaar est une langue à "faibles ressources", et ce modèle vise à réduire la fracture numérique.
- Développé par : Morlaye Cis (Master MIAGE / Mémoire de recherche)
- Type de modèle : Encoder-Decoder (Seq2Seq)
- Langues : Pulaar (Caractères latins) <-> Français
- Finetuned à partir de : facebook/nllb-200-distilled-600M
Uses
Direct Use
- Traduction de phrases liées à l'état civil (mariage, naissance, décès).
- Aide à la rédaction de demandes de certificats administratifs.
- Support pour les agents de mairie lors de l'accueil des usagers parlant Pulaar.
Out-of-Scope Use
- Traduction médicale complexe ou juridique de haut niveau.
- Textes littéraires ou poétiques (le modèle est optimisé pour le style administratif direct).
Bias, Risks, and Limitations
- Biais de domaine : Le modèle peut avoir tendance à traduire des phrases générales vers un contexte administratif.
- Limitation linguistique : Le modèle utilise principalement la variante du Pulaar parlée au Sénégal.
- Risques : Ne pas utiliser pour des décisions juridiques critiques sans vérification humaine.
How to Get Started with the Model
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
model_id = "morlayecis0003/nllb-200-pulaar-mairie"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
text = "So a waylii kominaa, potaa anndinde kominaa ɓooyɗo on."
inputs = tokenizer(text, return_tensors="pt")
translated_tokens = model.generate(
**inputs,
forced_bos_token_id=tokenizer.convert_tokens_to_ids("fra_Latn"),
max_length=128
)
print(tokenizer.batch_decode(translated_tokens, skip_special_tokens=True)[0])