ARPRIM/pulaar_fulfulde
ARPRIM Saggitorde — Corpus de phrases alignées Français ⇄ Pulaar Ce corpus rassemble des phrases et paragraphes alignés français ⇄ pulaar (fulfulde), extraits de documents institutionnels, littéraires et scientifiques mauritaniens, dans le cadre du projet ARPRIM. Contrairement au dictionnaire terminologique ARPRIM (qui aligne des mots et expressions isolés), ce corpus aligne des unités de discours complètes (phrases, répliques, paragraphes), ce qui le rend utile pour… See the full description on the dataset page: https://huggingface.co/datasets/ARPRIM/pulaar_fulfulde.
ARPRIM Saggitorde — Corpus de phrases alignées Français ⇄ Pulaar
Ce corpus rassemble des phrases et paragraphes alignés français ⇄ pulaar (fulfulde), extraits de documents institutionnels, littéraires et scientifiques mauritaniens, dans le cadre du projet ARPRIM. Contrairement au dictionnaire terminologique ARPRIM (qui aligne des mots et expressions isolés), ce corpus aligne des unités de discours complètes (phrases, répliques, paragraphes), ce qui le rend utile pour l'entraînement ou l'évaluation de systèmes de traduction automatique.
Contenu
- 1 708 paires de phrases alignées, réparties sur 37 thèmes et issues de 10 sources.
- Environ 92 000 mots côté français.
Fichiers
Structure d'une entrée
{
"id": "ARPRIM_C_0013",
"t": "Confinement COVID-19",
"f": "Une fois votre guérison est confirmée par votre médecin, vos vêtements doivent être lavés à l'eau chaude...",
"p": "So cafroowo maa teeŋtinanii ma a seertii e ñawu hee haa laaɓi, comci maa ine poti wuppireede ndiyam ngulɗam...",
"s": "SOS_Pairs_Educateurs_Mauritanie"
}id: identifiant unique et stable de la paire.t: thème ou titre de la section dont est issue la paire.f: texte en français.p: texte en pulaar (fulfulde) correspondant.s: source documentaire d'origine (voir tableau ci-dessous).
Répartition par source
Utilisation avec 🤗 datasets
from datasets import load_dataset
ds = load_dataset("ARPRIM/Pulaar_Corpus", data_files="ARPRIM_corpus_phrases_v1.jsonl")
print(ds["train"][0])Utilisation avec pandas
import pandas as pd
df = pd.read_json("ARPRIM_corpus_phrases_v1.jsonl", lines=True)
print(df.head())Consultation en ligne
Le fichier Taro_konngi_cawndondirdi_fr-ff.html est une application autonome (aucune dépendance serveur) : il suffit de l'ouvrir dans un navigateur pour parcourir et rechercher les paires de phrases.
Avertissement sur la nature des sources
Certaines sources (notamment NGONNOO_MI_ARPRIM) contiennent un témoignage historique sur des événements graves survenus en Mauritanie (déportations de 1989-1991). Ce contenu est inclus à des fins de documentation linguistique et de mémoire historique, sans prise de position éditoriale de la part du projet ARPRIM.
Licence et attribution
Ce jeu de données est distribué sous licence CC BY 4.0. Merci de citer le projet ARPRIM et les sources documentaires d'origine (association SOS Pairs Éducateurs, textes législatifs mauritaniens, etc.) en cas de réutilisation.
