Shads229/french-fongbe-corpus
French-Fongbe Parallel Corpus (Fon-Dataset-Generator) Description Ce dataset est un corpus parallèle Français-Fongbe (Bénin) généré par IA et structuré pour l'entraînement de modèles de langue (LLM Fine-tuning). Il couvre divers aspects de la vie quotidienne : santé, commerce, émotions, proverbes, et interactions sociales. Structure des données Le dataset est au format JSONL. Chaque entrée contient : messages : Un format compatible avec le… See the full description on the dataset page: https://huggingface.co/datasets/Shads229/french-fongbe-corpus.
French-Fongbe Parallel Corpus (Fon-Dataset-Generator)
Description
Ce dataset est un corpus parallèle Français-Fongbe (Bénin) généré par IA et structuré pour l'entraînement de modèles de langue (LLM Fine-tuning). Il couvre divers aspects de la vie quotidienne : santé, commerce, émotions, proverbes, et interactions sociales.
Structure des données
Le dataset est au format JSONL. Chaque entrée contient :
messages: Un format compatible avec le fine-tuning OpenAI/DeepSeek (User: phrase en Français, Assistant: traduction en Fon).metadata: Catégorie de la phrase et timestamp.
Comment l'utiliser
Vous pouvez charger ce dataset directement via la librairie datasets :
from datasets import load_dataset
dataset = load_dataset("votre-username/nom-du-repo")Éthique et Qualité
Les données ont été générées via LLM. Bien que la structure soit de haute qualité, une validation par des locuteurs natifs est recommandée pour les tons spécifiques du Fongbe.
Projet lié : GitHub Fon-Dataset-Generator Visualisation : Google Sheets
