CoolFace
Datasetpublic

Semence/vaximere-qa-cg

VaxiMère-QA-CG Dataset d'intentions multilingue (français fra, lingala lin, kituba/munukutuba mkw) sur la vaccination pédiatrique au Congo-Brazzaville, destiné au fine-tuning LoRA d'un classifieur d'intentions (ex. Gemma 3). Structure Chaque exemple est un JSON avec 7 champs : { "query_id": "Q_001_FR", "texte": "Pourquoi vacciner mon enfant même s'il semble en bonne santé", "langue": "fra", "intention": "UTILITE_VACCIN", "faq_target_id": "FAQ_001"… See the full description on the dataset page: https://huggingface.co/datasets/Semence/vaximere-qa-cg.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
0likes52downloads
Dataset Card

VaxiMère-QA-CG

Dataset d'intentions multilingue (français fra, lingala lin, kituba/munukutuba mkw) sur la vaccination pédiatrique au Congo-Brazzaville, destiné au fine-tuning LoRA d'un classifieur d'intentions (ex. Gemma 3).

Structure

Chaque exemple est un JSON avec 7 champs :

json
{
  "query_id": "Q_001_FR",
  "texte": "Pourquoi vacciner mon enfant même s'il semble en bonne santé",
  "langue": "fra",
  "intention": "UTILITE_VACCIN",
  "faq_target_id": "FAQ_001",
  "source": "seed_curated",
  "score": 1.0
}
  • —720 exemples = 240 français + 240 lingala + 240 kituba
  • —8 intentions × 90 exemples :

UTILITE_VACCIN, SECURITE_VACCIN, CALENDRIER_RDV, RETARD_RATTRAPAGE, EFFET_SECONDAIRE, RUMEUR_CROYANCE, LOCALISATION_ACCES, HORS_DOMAINE_CLINIQUE

Construction

  1. 1.Extraction : qanastek/frenchmedmcqa (Apache-2.0), ANR-MALADES/MediQAl config oeq (CC-BY-4.0), complétés par une banque de ~272 questions rédigées (source=seed_curated).
  2. 2.Filtrage : mots-clés du domaine vaccination pédiatrique (rougeole, polio, BCG, Penta, carnet vaccinal, fièvre après vaccin…).
  3. 3.Classification zero-shot : MoritzLaurer/mDeBERTa-v3-base-mnli-xnli, seuil de confiance ≥ 0.70.
  4. 4.Traduction : facebook/nllb-200-distilled-600M (CC-BY-NC-4.0) vers lin_Latn (lingala) et kon_Latn (kikongo, utilisé pour simuler le kituba, NLLB n'ayant pas de code kituba dédié).

Licence

  • —`cc-by-nc-4.0` : usage non commercial, car les traductions lingala/kituba sont dérivées de NLLB-200 (CC-BY-NC-4.0).
  • —La partie française (seed + FrenchMedMCQA Apache-2.0 + MediQAl CC-BY-4.0) serait compatible commercial ; re-traduire avec un modèle permissif (ex. MADLAD-400, Apache-2.0) permettrait une licence plus permissive.

Biais & limites

  • —Les questions lingala/kituba sont des traductions automatiques, pas des énoncés natifs ; les tournures idiomatiques locales sont sous-représentées.
  • —kon_Latn (kikongo) approxime le kituba/munukutuba.
  • —La classification zero-shot est automatique : une relecture humaine est recommandée malgré le seuil 0.70.
  • —Les questions seed sont synthétiques (modélisation de situations plausibles), en particulier pour RUMEUR_CROYANCE et HORS_DOMAINE_CLINIQUE.

Éthique

  • —Aucune donnée personnelle ni identifiant patient.
  • —Les réponses FAQ sont alignées sur le PEV congolais / OMS et portent la mention « à valider par un médecin ».
  • —HORS_DOMAINE_CLINIQUE doit déclencher un transfert vers un agent de santé ; le modèle ne doit jamais formuler d'avis clinique.

Voir le dépôt source pour le pipeline complet : https://github.com/maick-code/AIMS-Capstone