CoolFace
Datasetpublic

alianassmaaa/ameli-assurance-maladie-qa

Ameli Assurance Maladie - Question Answering Dataset Description Dataset de 100 paires question-réponse (QA) basé sur les publications officielles de l'Assurance Maladie française, extraites du site assurance-maladie.ameli.fr. Conçu pour évaluer des systèmes de RAG (Retrieval-Augmented Generation) sur des documents institutionnels français dans le domaine de la santé publique et de la protection sociale. Format du dataset { "question": "Quel… See the full description on the dataset page: https://huggingface.co/datasets/alianassmaaa/ameli-assurance-maladie-qa.

sourceHugging Facecc-by-4.0updated 5mo agoView on Hugging Face
1likes341downloads
Dataset Card

Ameli Assurance Maladie - Question Answering Dataset

Description

Dataset de 100 paires question-réponse (QA) basé sur les publications officielles de l'Assurance Maladie française, extraites du site assurance-maladie.ameli.fr.

Conçu pour évaluer des systèmes de RAG (Retrieval-Augmented Generation) sur des documents institutionnels français dans le domaine de la santé publique et de la protection sociale.

Format du dataset

json
{
  "question": "Quel article du code de la Sécurité sociale fonde la COG ?",
  "golden_response": "La COG est fondée sur l'article L227-1 du code de la Sécurité sociale.",
  "expected_sources": [
    {
      "rank": 1,
      "content": "En application de l'article L227-1 du code de la Sécurité sociale, l'État conclut avec la Cnam une convention d'objectifs et de gestion (COG)...",
      "doc_name": "COG_2023-2027_Cnam.pdf",
      "relevance_score": 1.0,
      "retriever_type": "gold"
    },
    {
      "rank": 2,
      "content": "Début 2018, l'État et la Cnam ont signé une nouvelle convention d'objectifs et de gestion (COG) pour la période 2018-2022...",
      "doc_name": "web_convention-objectifs-gestion.txt",
      "relevance_score": 0.75,
      "retriever_type": "gold"
    }
  ],
  "metadata": {
    "question_type": "simple",
    "difficulty": "easy",
    "topic": "gouvernance"
  }
}

Champs

ChampTypeDescription
questionstringQuestion factuelle basée sur le contenu des documents
golden_responsestringRéponse correcte et concise
expected_sourceslist[object]Passages sources extraits (1 à 3 par question)
expected_sources[].rankintRang de pertinence (1 = plus pertinent)
expected_sources[].contentstringPassage exact extrait du document
expected_sources[].doc_namestringNom du fichier source
expected_sources[].relevance_scorefloatScore de pertinence (0.0–1.0)
expected_sources[].retriever_typestring"gold" = passage vérifié manuellement
metadata.question_typestringType de question (voir taxonomie ci-dessous)
metadata.difficultystringeasy, medium, hard
metadata.topicstringThématique de la question

Taxonomie des types de questions

TypeDescriptionNombre
simpleQuestion directe, réponse dans un seul passage18
numericalRequiert l'extraction de chiffres/statistiques précis46
complexNécessite la synthèse de plusieurs informations18
temporalPorte sur une évolution dans le temps7
comparativeCompare deux entités/périodes/documents4
multi_documentRequiert obligatoirement la consultation de 2+ documents4
test_hallucinationQuestion piège — vérifie que le modèle ne fabrique pas d'information2
ambiguousQuestion dont la réponse nécessite une interprétation nuancée1

Distribution des sources

  • —1 source : 55 questions
  • —2 sources : 44 questions
  • —3+ sources : 1 question
  • —Total multi-source : 45 questions (45%)

Distribution par difficulté

DifficultéNombre
easy43
medium39
hard18

Documents sources (15 documents)

PDFs (14 documents)

DocumentPagesContenu
COG_2023-2027_Cnam.pdf148Convention d'objectifs et de gestion État-Cnam 2023-2027
COG_ATMP_2023-2028.pdf83COG AT/MP 2023-2028
COG_ATMP_2018-2022.pdf76COG AT/MP 2018-2022
Rapport_charges_produits_2021.pdf268Propositions Charges et produits 2021
Rapport_mediation_2022.pdf54Rapport médiation 2022
Rapport_activite_2018.pdf30Rapport d'activité 2018
Rapport_activite_2017.pdf33Rapport d'activité 2017
Affections_psychiques_travail_2018.pdf20Affections psychiques au travail (2018)
Cancers_professionnels_2019.pdf27Cancers professionnels (2019)
Chutes_travail_2022.pdf9Chutes au travail (2022)
Lombalgies_travail_2017.pdf16Lombalgies au travail (2017)
COG_2018-2022_Cnam.pdf—COG État-Cnam 2018-2022
Rapport_charges_produits_2020.pdf—Propositions pour 2020
Rapport_tiers_payant_2016.pdf—Rapport tiers payant 2016

Pages web (12 pages)

Pages de présentation des publications : COG, rapports d'activité, médiation, charges et produits, Santé Travail, tiers payant.

Thématiques couvertes

ThématiqueNb questions
santé_travail14
médiation10
cancers_professionnels9
chutes_travail9
finances9
lombalgies7
gouvernance_atmp7
organisation7
prévention6
gouvernance5
accèsauxsoins4
numérique3
autres (services, covid, fraude, donnéessanté, transitionécologique, cancers)10

Qualité

  • —✅ Réponses strictement extraites des documents sources
  • —✅ Chaque expected_sources[].content = passage exact du document cité
  • —✅ Aucune hallucination : chaque fait est vérifiable
  • —✅ 45% de questions multi-sources avec passages de documents différents
  • —✅ Taxonomie de types de questions pour évaluation ciblée
  • —✅ 3 niveaux de difficulté pour benchmarking progressif

Usage

python
from datasets import load_dataset

dataset = load_dataset("alianassmaaa/ameli-assurance-maladie-qa")

# Filtrer par type
hallucination_tests = [s for s in dataset["train"] if s["metadata"]["question_type"] == "test_hallucination"]
hard_questions = [s for s in dataset["train"] if s["metadata"]["difficulty"] == "hard"]
multi_source = [s for s in dataset["train"] if len(s["expected_sources"]) >= 2]

# Exemple
sample = dataset["train"][0]
print(f"Type: {sample['metadata']['question_type']}")
print(f"Question: {sample['question']}")
print(f"Réponse: {sample['golden_response']}")
for src in sample['expected_sources']:
    print(f"  [{src['rank']}] {src['doc_name']} (score={src['relevance_score']})")
    print(f"      {src['content'][:100]}...")

Fichiers

├── data/train.jsonl           # JSONL (compatible HF datasets)
├── ameli_qa_dataset.json      # JSON complet
└── documents/                 # Tous les documents sources (PDF + TXT)

Source

Documents du site officiel : https://www.assurance-maladie.ameli.fr/qui-sommes-nous/publications-reference/assurance-maladie

Licence

CC-BY-4.0