monespacesante
L40S-MonEspaceSante-eval-suite
Mon Espace Santé — Suite d'évaluation (closed-book)
Jeux d'évaluation gelés avant tout entraînement pour mesurer l'ingestion de connaissances en
closed-book (sans contexte) et la résistance à l'hallucination. Utilisés pour comparer les modèles
fenyo/L40S-Qwen3-8B-MonEspaceSante-CPT-SFT
et fenyo/gpt-oss-20b-FAQ-MES.
Fichiers
Fichier
N
Description
facts.jsonl
88
Faits de référence (vérité) : fact_id, question, answer, category
test_heldout.jsonl
696… See the full description on the dataset page: https://huggingface.co/datasets/fenyo/L40S-MonEspaceSante-eval-suite.L40S-MonEspaceSante-SFT-dataset
Mon Espace Santé — Données SFT (Q/R)
Paires question/réponse en français pour l'étape SFT (instruction-following / format) du modèle
fenyo/L40S-Qwen3-8B-MonEspaceSante-CPT-SFT.
Conformément à Gekhman et al. (arXiv:2405.05904), la connaissance est injectée au CPT (cf.
corpus CPT) ; le SFT ne sert qu'à
restaurer le format Q/R, pas à mémoriser.
Composition (2 771 paires, après décontamination)
Toutes les paires sont 1-hop des 88 faits réels :
real — les 88 faits… See the full description on the dataset page: https://huggingface.co/datasets/fenyo/L40S-MonEspaceSante-SFT-dataset.MonEspaceSante-FAQ-QA
MonEspaceSanté FAQ — paires Q/R (réelles + synthétiques)
Jeu de paires question / réponse en français ayant servi à fine-tuner l'assistant
MonEspaceSanté-FAQ-Mistral-Small-24B-GGUF,
spécialisé sur la FAQ du service public Mon espace santé.
Le jeu mélange les questions/réponses officielles de la FAQ (vérité terrain) et une
augmentation synthétique ancrée : des reformulations variées générées par un modèle
enseignant, dont chaque réponse est strictement justifiée par le texte… See the full description on the dataset page: https://huggingface.co/datasets/fenyo/MonEspaceSante-FAQ-QA.L40S-MonEspaceSante-refusals
Mon Espace Santé — Exemples de refus (anti-hallucination)
588 paires question (hors-périmètre) → réponse de refus, destinées à apprendre à un modèle à
avouer son ignorance plutôt qu'à inventer, sur des questions non couvertes par la FAQ
Mon espace santé. Utilisées pour le SFT du modèle
fenyo/L40S-Qwen3-8B-MonEspaceSante-CPT-SFT-anti-hallucination.
Pourquoi
Un modèle entraîné uniquement sur des positives apprend « réponds toujours » → il hallucine sur
les questions… See the full description on the dataset page: https://huggingface.co/datasets/fenyo/L40S-MonEspaceSante-refusals.L40S-MonEspaceSante-CPT-corpus
Mon Espace Santé — Corpus CPT synthétique
Corpus synthétique de continued pre-training (CPT) généré à partir de 88 faits réels (paires
Q/R « grounded ») de la FAQ du service public français Mon espace santé
(fenyo/MonEspaceSante-FAQ-QA, source == "real").
But : injecter ces connaissances dans les poids d'un LLM sans RAG. Ce corpus sert au CPT décrit dans
le modèle fenyo/L40S-Qwen3-8B-MonEspaceSante-CPT-SFT.
Génération (résumé)
Générateur : Qwen3-32B-FP8 servi par… See the full description on the dataset page: https://huggingface.co/datasets/fenyo/L40S-MonEspaceSante-CPT-corpus.H100-MonEspaceSante-eval
🔧 Code & reproduction complète (scripts, RUNBOOK, reproduce.sh, conversations) : https://github.com/AlexandreFenyo/MonEspaceSante-H100-reproduction
Mon espace santé — Jeux d'évaluation closed-book
Jeux gelés AVANT toute génération d'entraînement, servant à l'évaluation closed-book notée par
LLM-juge (Qwen3-32B), et à la décontamination des corpus d'entraînement.
Fichiers
heldout_test.jsonl (704) — jeu de test principal. Pour chacun des 88 faits real, ~8… See the full description on the dataset page: https://huggingface.co/datasets/fenyo/H100-MonEspaceSante-eval.
