CoolFace
Datasetpublic

Shads229/french-fongbe-corpus

French-Fongbe Parallel Corpus (Fon-Dataset-Generator) Description Ce dataset est un corpus parallèle Français-Fongbe (Bénin) généré par IA et structuré pour l'entraînement de modèles de langue (LLM Fine-tuning). Il couvre divers aspects de la vie quotidienne : santé, commerce, émotions, proverbes, et interactions sociales. Structure des données Le dataset est au format JSONL. Chaque entrée contient : messages : Un format compatible avec le… See the full description on the dataset page: https://huggingface.co/datasets/Shads229/french-fongbe-corpus.

sourceHugging Facemitupdated 7mo agoView on Hugging Face
1likes15downloads
Dataset Card

French-Fongbe Parallel Corpus (Fon-Dataset-Generator)

Description

Ce dataset est un corpus parallèle Français-Fongbe (Bénin) généré par IA et structuré pour l'entraînement de modèles de langue (LLM Fine-tuning). Il couvre divers aspects de la vie quotidienne : santé, commerce, émotions, proverbes, et interactions sociales.

Structure des données

Le dataset est au format JSONL. Chaque entrée contient :

  • —messages : Un format compatible avec le fine-tuning OpenAI/DeepSeek (User: phrase en Français, Assistant: traduction en Fon).
  • —metadata : Catégorie de la phrase et timestamp.

Comment l'utiliser

Vous pouvez charger ce dataset directement via la librairie datasets :

python
from datasets import load_dataset
dataset = load_dataset("votre-username/nom-du-repo")

Éthique et Qualité

Les données ont été générées via LLM. Bien que la structure soit de haute qualité, une validation par des locuteurs natifs est recommandée pour les tons spécifiques du Fongbe.


Projet lié : GitHub Fon-Dataset-Generator Visualisation : Google Sheets