CoolFace
Datasetpublic

rntc/gliner2-fr-biomed-v3d

GLiNER2 FR Biomédical — données d'entraînement multi-tâches (v3d) Données synthétiques d'entraînement pour un GLiNER2 français biomédical généraliste open-vocabulary, dans la lignée GLiNER / NuNER / GLiNER-biomed (distillation depuis un LLM, pas d'entraînement sur du gold de benchmark). Langue : français Domaine : biomédical / clinique Tâches : NER open-vocab · classifications · extraction structurée (json_structures) · relations Annotateur : Qwen3-235B-A22B-Instruct-2507 (FP8)… See the full description on the dataset page: https://huggingface.co/datasets/rntc/gliner2-fr-biomed-v3d.

sourceHugging Facemitupdated 3mo agoView on Hugging Face
0likes30downloads
Dataset Card

GLiNER2 FR Biomédical — données d'entraînement multi-tâches (v3d)

Données synthétiques d'entraînement pour un GLiNER2 français biomédical généraliste open-vocabulary, dans la lignée GLiNER / NuNER / GLiNER-biomed (distillation depuis un LLM, pas d'entraînement sur du gold de benchmark).

  • —Langue : français
  • —Domaine : biomédical / clinique
  • —Tâches : NER open-vocab · classifications · extraction structurée (json_structures) · relations
  • —Annotateur : Qwen3-235B-A22B-Instruct-2507 (FP8), sortie JSON contrainte par schéma
  • —Splits : train 90 472 · validation 3 769
  • —Licence : MIT

Format

Une ligne JSON = un document. Format natif GLiNER2 :

json
{
  "input": "<texte>",
  "output": {
    "entities": {"<type>": ["<mention>", ...], ...},
    "classifications": [{"task": "...", "labels": [...], "true_label": [...], "multi_label": bool}],
    "json_structures": [{"<schema>": {"<champ>": "<valeur>"}}],
    "relations": [{"<relation>": {"head": "...", "tail": "..."}}]
  }
}
  • —entities est toujours présent. Les types sont open-vocabulary (lemmes français génériques, granularité L1→L4 proche d'UMLS). Les mentions sont des sous-chaînes exactes du texte (grounding vérifié).
  • —classifications / json_structures / relations sont présents quand le document les supporte (0 sinon).
  • —Négatifs : ~28 % des documents sont non-biomédicaux → entities à listes de mentions vides (domain-gate, utile pour la précision).
  • —Classification CIM-10 : sur les documents cliniques, une tâche chapitre CIM-10 (22 chapitres, multi-label) est ajoutée (≈ 61 k documents).

Construction (résumé)

  1. 1.Corpus sources : littérature biomédicale FR (HAL, istex), case reports PMC traduits FR, vulgarisation (finewiki-medical), reformulations de nomenclatures (CIM-10 / ATC / CCAM), + ~18 % de notes cliniques « brouillon » (registre télégraphique, abréviations).
  2. 2.Annotation : appel unique au LLM avec un schéma 6-sections (candidate-spans → entities subset, classifications, json_structures, relations, hard-negatives), densité modérée naturelle, domain-gate (ne tagger que le biomédical).
  3. 3.Grounding : chaque mention / head / tail doit être une sous-chaîne exacte du texte ; anti-raccourci lexical (Levenshtein type↔mention ≥ 3).
  4. 4.Assemblage : format 4-tâches GLiNER2 ; les labels CIM-10 sont snappés sur les 22 chapitres canoniques.

Usage prévu

Entraîner un GLiNER2 FR biomédical généraliste (l'utilisateur définit ses types à l'inférence). L'objectif est la généralisation aux types nouveaux/arbitraires, pas l'alignement de convention sur un benchmark donné.

Limites & avertissements

  • —Données SYNTHÉTIQUES (silver) : annotations produites par un LLM, pas du gold humain. Erreurs et biais de l'annotateur possibles.
  • —Ne pas considérer comme une ressource clinique validée. Aucune donnée patient réelle : les textes cliniques sont synthétiques ou dérivés de sources publiques (PMC).
  • —Pensée pour la recherche (distillation open-vocab), à évaluer en zero-shot reference-free plutôt que sur les benchmarks NER standards.

Citation

À compléter (paper en préparation).