CoolFace
Datasetpublic

Houzeric/french-prompts-and-questions

Dataset français Prompt / Answer (multi-sources) 📌 Description Ce dataset est un jeu de données en français au format prompt / answer, conçu pour l’entraînement, le fine-tuning et l’évaluation de modèles de langage (LLM). Il résulte de la fusion et de la normalisation de plusieurs datasets publics, afin de proposer un format simple, homogène et facilement exploitable. Chaque entrée contient : prompt : question ou instruction utilisateur answer : réponse attendue… See the full description on the dataset page: https://huggingface.co/datasets/Houzeric/french-prompts-and-questions.

sourceHugging Faceapache-2.0updated 9mo agoView on Hugging Face
1likes94downloads
Dataset Card

Dataset français Prompt / Answer (multi-sources)

📌 Description

Ce dataset est un jeu de données en français au format `prompt / answer`, conçu pour l’entraînement, le fine-tuning et l’évaluation de modèles de langage (LLM).

Il résulte de la fusion et de la normalisation de plusieurs datasets publics, afin de proposer un format simple, homogène et facilement exploitable.

Chaque entrée contient :

  • —prompt : question ou instruction utilisateur
  • —answer : réponse attendue
  • —type : source de l’exemple (traçabilité)

🧩 Sources des données

Ce dataset est inspiré et dérivé des datasets publics suivants.

1️⃣ Natural Questions – version française

  • —Dataset source : oliverguhr/natural-questions-french
  • —Description : questions factuelles en français avec réponses associées

Transformations appliquées :

  • —query_fr → prompt
  • —answer_fr → answer
  • —Ajout du champ type = "natural_questions"

2️⃣ French Instruct

  • —Dataset source : angeluriot/french_instruct
  • —Description : conversations instructionnelles humain ↔ assistant

Filtrage appliqué :

  • —conservation uniquement des lignes dont le champ source contient "Human ChatGPT"

Transformations appliquées :

  • —message avec role == "user" → prompt
  • —message avec role == "assistant" → answer
  • —Ajout du champ type = "human_chatgpt"

🗂️ Structure du dataset

Le dataset est fourni au format JSON Lines (`.jsonl`).

Exemple d’entrée

json
{
  "prompt": "Quelle est la capitale du Canada ?",
  "answer": "Ottawa",
  "type": "natural_questions"
},
{
  "prompt": "Explique la photosynthèse comme si j'avais cinq ans.",
  "answer": "La photosynthèse, c’est quand les plantes utilisent la lumière du soleil...",
  "type": "human_chatgpt"
}

🚀 Chargement et utilisation

python
from datasets import load_dataset

dataset = load_dataset("TON_NOM_DE_COMPTE/NOM_DU_DATASET")
train_data = dataset["train"]

🎯 Cas d’usage

  • —Fine-tuning de modèles de langage français
  • —Instruction tuning
  • —Question Answering
  • —Entraînement multi-sources avec traçabilité
  • —Analyse comparative par type de données

⚖️ Licence et crédits

Ce dataset est une œuvre dérivée de datasets publics existants.

Les données sources originales restent soumises à leurs licences respectives :

  • —oliverguhr/natural-questions-french
  • —angeluriot/french_instruct

Les transformations effectuées dans ce dataset incluent uniquement :

  • —la sélection de champs
  • —le filtrage des données
  • —la normalisation vers un format commun (prompt / answer)

📝 Notes importantes

  • —Aucune donnée privée ou sensible n’a été ajoutée
  • —Le dataset est fourni tel quel, sans garantie
  • —Le format a été volontairement simplifié pour maximiser la compatibilité avec les pipelines LLM modernes