fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT-RTX5090-GGUF
🔧 Code & reproduction complète : github.com/AlexandreFenyo/MonEspaceSante-H100-reproduction
Qwen3-14B « Mon espace santé » (CPT+SFT) — GGUF Q8_0, entraîné sur H100, prêt pour RTX 5090
Version GGUF Q8_0 (quantification légère, quasi sans perte — préserve les faits injectés dans les poids) du modèle `fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT`, pensée pour tourner localement sur une RTX 5090 (32 Go) via Ollama / llama.cpp.
- Produit sur : NVIDIA H100 80 Go (génération synthétique EntiGraph + CPT full-FT + SFT).
- Cible : NVIDIA RTX 5090 32 Go (Blackwell). Le fichier Q8_0 fait ~15 Go → tient largement en VRAM avec un grand contexte.
- Modèle closed-book spécialisé sur la FAQ du service public français « Mon espace santé ».
⚠️ Format de prompt SPÉCIFIQUE
Ce modèle n'est pas un modèle de chat générique. Il a été entraîné sur le format fixe :
Question : <votre question>
Réponse : <réponse>Le Modelfile fourni (et le chat-template embarqué dans le GGUF) reproduit exactement ce format. N'utilisez pas un template de chat Qwen standard, sinon la qualité s'effondre.
Installation avec Ollama (RTX 5090)
Pré-requis : Ollama récent (support Blackwell/CUDA 12.8+, ≥ fin 2025).
# 1) Récupérer les deux fichiers de ce dépôt
huggingface-cli download fenyo/H100-Qwen3-14B-MonEspaceSante-CPT-SFT-RTX5090-GGUF \
mes-faq-14b-Q8_0.gguf Modelfile --local-dir mes-faq-gguf
cd mes-faq-gguf
# 2) Créer le modèle Ollama (le Modelfile encode le format + température 0 pour la reproductibilité)
ollama create mes-faq -f Modelfile
# 3) Interroger (closed-book)
ollama run mes-faq "Comment activer mon profil Mon espace santé ?"
ollama run mes-faq "Qui peut consulter mes documents de santé ?"Le Modelfile fixe temperature 0, top_k 1, seed 0 → réponses déterministes/reproductibles, et des stop pour couper proprement après la réponse.
Performance (closed-book, jeu de test held-out 704, juge Qwen3-32B)
(Mesures sur le modèle bf16 source ; le Q8_0 est quasi-équivalent.)
Détails
- Quantification : Q8_0 (~8,5 bits/poids), 443 tenseurs, architecture
qwen3, contexte 32k. - Conversion :
llama.cpp/convert_hf_to_gguf.pypuisllama-quantize … Q8_0. - Alternatives plus légères (si besoin de moins de VRAM/disk) : reconvertir en
Q6_K(~12 Go) ouQ5_K_M(~10 Go) depuis le modèle source — Q8_0 est toutefois recommandé pour préserver le rappel factuel. - Modèle de base : `Qwen/Qwen3-14B-Base` → base enrichie `…-MonEspaceSante-CPT` → ce CPT+SFT.
Hors du domaine « Mon espace santé », le modèle refuse (entraînement anti-hallucination) ou répond comme un Qwen3-14B de base.
