CoolFace
Modelpublic

fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT-RTX5090-GGUF

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes20downloads
Model Card
🔧 Code & reproduction complète : github.com/AlexandreFenyo/MonEspaceSante-H100-reproduction

Qwen3-14B « Mon espace santé » (CPT+SFT) — GGUF Q8_0, entraîné sur H100, prêt pour RTX 5090

Version GGUF Q8_0 (quantification légère, quasi sans perte — préserve les faits injectés dans les poids) du modèle `fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT`, pensée pour tourner localement sur une RTX 5090 (32 Go) via Ollama / llama.cpp.

  • —Produit sur : NVIDIA H100 80 Go (génération synthétique EntiGraph + CPT full-FT + SFT).
  • —Cible : NVIDIA RTX 5090 32 Go (Blackwell). Le fichier Q8_0 fait ~15 Go → tient largement en VRAM avec un grand contexte.
  • —Modèle closed-book spécialisé sur la FAQ du service public français « Mon espace santé ».

⚠️ Format de prompt SPÉCIFIQUE

Ce modèle n'est pas un modèle de chat générique. Il a été entraîné sur le format fixe :

Question : <votre question>
Réponse : <réponse>

Le Modelfile fourni (et le chat-template embarqué dans le GGUF) reproduit exactement ce format. N'utilisez pas un template de chat Qwen standard, sinon la qualité s'effondre.

Installation avec Ollama (RTX 5090)

Pré-requis : Ollama récent (support Blackwell/CUDA 12.8+, ≥ fin 2025).

bash
# 1) Récupérer les deux fichiers de ce dépôt
huggingface-cli download fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT-RTX5090-GGUF \
  mes-faq-14b-Q8_0.gguf Modelfile --local-dir mes-faq-gguf
cd mes-faq-gguf

# 2) Créer le modèle Ollama (le Modelfile encode le format + température 0 pour la reproductibilité)
ollama create mes-faq -f Modelfile

# 3) Interroger (closed-book)
ollama run mes-faq "Comment activer mon profil Mon espace santé ?"
ollama run mes-faq "Qui peut consulter mes documents de santé ?"

Le Modelfile fixe temperature 0, top_k 1, seed 0 → réponses déterministes/reproductibles, et des stop pour couper proprement après la réponse.

Performance (closed-book, jeu de test held-out 704, juge Qwen3-32B)

Ce modèle (14B CPT+SFT)gpt-oss-20b-FAQ-MES (20B)SFT direct 14B (sans CPT)
Exactitude (strict)63,8 %42,5 %37,2 %
Exactitude (indulgent)80,3 %67,8 %61,1 %
Hallucination hors-domaine12 %60 %56 %

(Mesures sur le modèle bf16 source ; le Q8_0 est quasi-équivalent.)

Détails

  • —Quantification : Q8_0 (~8,5 bits/poids), 443 tenseurs, architecture qwen3, contexte 32k.
  • —Conversion : llama.cpp/convert_hf_to_gguf.py puis llama-quantize … Q8_0.
  • —Alternatives plus légères (si besoin de moins de VRAM/disk) : reconvertir en Q6_K (~12 Go) ou Q5_K_M (~10 Go) depuis le modèle source — Q8_0 est toutefois recommandé pour préserver le rappel factuel.
  • —Modèle de base : `Qwen/Qwen3-14B-Base` → base enrichie `…-MonEspaceSante-CPT` → ce CPT+SFT.

Hors du domaine « Mon espace santé », le modèle refuse (entraînement anti-hallucination) ou répond comme un Qwen3-14B de base.