Semence/vaximere-qa-cg
VaxiMère-QA-CG Dataset d'intentions multilingue (français fra, lingala lin, kituba/munukutuba mkw) sur la vaccination pédiatrique au Congo-Brazzaville, destiné au fine-tuning LoRA d'un classifieur d'intentions (ex. Gemma 3). Structure Chaque exemple est un JSON avec 7 champs : { "query_id": "Q_001_FR", "texte": "Pourquoi vacciner mon enfant même s'il semble en bonne santé", "langue": "fra", "intention": "UTILITE_VACCIN", "faq_target_id": "FAQ_001"… See the full description on the dataset page: https://huggingface.co/datasets/Semence/vaximere-qa-cg.
VaxiMère-QA-CG
Dataset d'intentions multilingue (français fra, lingala lin, kituba/munukutuba mkw) sur la vaccination pédiatrique au Congo-Brazzaville, destiné au fine-tuning LoRA d'un classifieur d'intentions (ex. Gemma 3).
Structure
Chaque exemple est un JSON avec 7 champs :
{
"query_id": "Q_001_FR",
"texte": "Pourquoi vacciner mon enfant même s'il semble en bonne santé",
"langue": "fra",
"intention": "UTILITE_VACCIN",
"faq_target_id": "FAQ_001",
"source": "seed_curated",
"score": 1.0
}- 720 exemples = 240 français + 240 lingala + 240 kituba
- 8 intentions × 90 exemples :
UTILITE_VACCIN, SECURITE_VACCIN, CALENDRIER_RDV, RETARD_RATTRAPAGE, EFFET_SECONDAIRE, RUMEUR_CROYANCE, LOCALISATION_ACCES, HORS_DOMAINE_CLINIQUE
Construction
- Extraction :
qanastek/frenchmedmcqa(Apache-2.0),ANR-MALADES/MediQAlconfigoeq(CC-BY-4.0), complétés par une banque de ~272 questions rédigées (source=seed_curated). - Filtrage : mots-clés du domaine vaccination pédiatrique (rougeole, polio, BCG, Penta, carnet vaccinal, fièvre après vaccin…).
- Classification zero-shot :
MoritzLaurer/mDeBERTa-v3-base-mnli-xnli, seuil de confiance ≥ 0.70. - Traduction :
facebook/nllb-200-distilled-600M(CC-BY-NC-4.0) verslin_Latn(lingala) etkon_Latn(kikongo, utilisé pour simuler le kituba, NLLB n'ayant pas de code kituba dédié).
Licence
- `cc-by-nc-4.0` : usage non commercial, car les traductions lingala/kituba sont dérivées de NLLB-200 (CC-BY-NC-4.0).
- La partie française (seed + FrenchMedMCQA Apache-2.0 + MediQAl CC-BY-4.0) serait compatible commercial ; re-traduire avec un modèle permissif (ex. MADLAD-400, Apache-2.0) permettrait une licence plus permissive.
Biais & limites
- Les questions lingala/kituba sont des traductions automatiques, pas des énoncés natifs ; les tournures idiomatiques locales sont sous-représentées.
kon_Latn(kikongo) approxime le kituba/munukutuba.- La classification zero-shot est automatique : une relecture humaine est recommandée malgré le seuil 0.70.
- Les questions seed sont synthétiques (modélisation de situations plausibles), en particulier pour
RUMEUR_CROYANCEetHORS_DOMAINE_CLINIQUE.
Éthique
- Aucune donnée personnelle ni identifiant patient.
- Les réponses FAQ sont alignées sur le PEV congolais / OMS et portent la mention « à valider par un médecin ».
HORS_DOMAINE_CLINIQUEdoit déclencher un transfert vers un agent de santé ; le modèle ne doit jamais formuler d'avis clinique.
Voir le dépôt source pour le pipeline complet : https://github.com/maick-code/AIMS-Capstone
