CoolFace
Datasetpublic

MaroneAI/Wolof-to-French_Translation-Dataset

Dataset Wolof ↔ Français 🧩 Présentation Ce dataset contient plus de 30 000 paires phrase Wolof – phrase Française.Chaque ligne est structurée comme suit : Wolof (input) Français (target) Phrase en Wolof Phrase correspondante en Français Il a été conçu pour la traduction automatique et les tâches de NLP impliquant le Wolof et le Français. 📚 Provenance et nettoyage Le dataset a été créé en compilant différentes sources accessibles… See the full description on the dataset page: https://huggingface.co/datasets/MaroneAI/Wolof-to-French_Translation-Dataset.

sourceHugging Facemitupdated 1y agoView on Hugging Face
3likes112downloads
Dataset Card

Dataset Wolof ↔ Français

🧩 Présentation

Ce dataset contient plus de 30 000 paires phrase Wolof – phrase Française. Chaque ligne est structurée comme suit :

Wolof (input)Français (target)
Phrase en WolofPhrase correspondante en Français

Il a été conçu pour la traduction automatique et les tâches de NLP impliquant le Wolof et le Français.


📚 Provenance et nettoyage

Le dataset a été créé en compilant différentes sources accessibles publiquement sur Internet. Toutes les données ont été nettoyées, filtrées et normalisées afin de garantir :

  • —La suppression des doublons et lignes vides.
  • —La cohérence des textes (espaces, majuscules/minuscules).
  • —La compatibilité pour un entraînement de modèles de traduction.

Pour créer ce dataset, certaines colonnes ont été inversées par rapport à un autre dataset préexistant afin de former des paires Wolof → Français.


⚙️ Structure et format

  • —Format : CSV
  • —Colonnes principales : input (Wolof), target (Français)
  • —Nombre de paires : 30 000+
  • —Encodage recommandé : UTF-8

Chaque paire est indépendante et prête à être utilisée pour l'entraînement ou l’évaluation de modèles de traduction.


🧠 Utilisation

Exemple simple avec Python et Pandas :

python
import pandas as pd

df = pd.read_csv("dataset_wolof_fr.csv", encoding="utf-8")
print(df.head())