datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
mece-fongbe-corpus
MƐCE — Corpus d'instruction Fongbe (Tune_Pigier)
Corpus d'instruction / conversation centré sur le Fongbe (fon), utilisé pour
fine-tuner l'assistant vocal MƐCE (mémoire de fin d'études, École PIGIER Bénin).
Contenu
Format : ChatML — chaque ligne JSON est un objet {"messages": [...]} avec des
rôles system / user / assistant.
Taille : ~140 000 exemples — train.jsonl (126 725) + eval.jsonl (14 089).
Langues : fon (principal, avec tons/diacritiques), fr, en.… See the full description on the dataset page: https://huggingface.co/datasets/CapitainVigs/mece-fongbe-corpus.french-fongbe-corpus
French-Fongbe Parallel Corpus (Fon-Dataset-Generator)
Description
Ce dataset est un corpus parallèle Français-Fongbe (Bénin) généré par IA et structuré pour l'entraînement de modèles de langue (LLM Fine-tuning). Il couvre divers aspects de la vie quotidienne : santé, commerce, émotions, proverbes, et interactions sociales.
Structure des données
Le dataset est au format JSONL. Chaque entrée contient :
messages : Un format compatible avec le fine-tuning… See the full description on the dataset page: https://huggingface.co/datasets/Shads229/french-fongbe-corpus.
