MaroneAI/Wolof-to-French_Translation-Dataset
Dataset Wolof ↔ Français 🧩 Présentation Ce dataset contient plus de 30 000 paires phrase Wolof – phrase Française.Chaque ligne est structurée comme suit : Wolof (input) Français (target) Phrase en Wolof Phrase correspondante en Français Il a été conçu pour la traduction automatique et les tâches de NLP impliquant le Wolof et le Français. 📚 Provenance et nettoyage Le dataset a été créé en compilant différentes sources accessibles… See the full description on the dataset page: https://huggingface.co/datasets/MaroneAI/Wolof-to-French_Translation-Dataset.
Dataset Wolof ↔ Français
🧩 Présentation
Ce dataset contient plus de 30 000 paires phrase Wolof – phrase Française. Chaque ligne est structurée comme suit :
Il a été conçu pour la traduction automatique et les tâches de NLP impliquant le Wolof et le Français.
📚 Provenance et nettoyage
Le dataset a été créé en compilant différentes sources accessibles publiquement sur Internet. Toutes les données ont été nettoyées, filtrées et normalisées afin de garantir :
- La suppression des doublons et lignes vides.
- La cohérence des textes (espaces, majuscules/minuscules).
- La compatibilité pour un entraînement de modèles de traduction.
Pour créer ce dataset, certaines colonnes ont été inversées par rapport à un autre dataset préexistant afin de former des paires Wolof → Français.
⚙️ Structure et format
- Format : CSV
- Colonnes principales :
input(Wolof),target(Français) - Nombre de paires : 30 000+
- Encodage recommandé : UTF-8
Chaque paire est indépendante et prête à être utilisée pour l'entraînement ou l’évaluation de modèles de traduction.
🧠 Utilisation
Exemple simple avec Python et Pandas :
import pandas as pd
df = pd.read_csv("dataset_wolof_fr.csv", encoding="utf-8")
print(df.head())
