CoolFace
Modelpublic

Sadou/medai-rural-qwen2.5-1.5b-gguf

sourceHugging Facecc-by-nc-4.0updated 4mo agoView on Hugging Face
0likes15downloads
Model Card

🩺 MedAI Rural — GGUF (pour Ollama / llama.cpp)

Version GGUF Q4_K_M quantizée du modèle Sadou/medai-rural-qwen2.5-1.5b-lora.

📊 Voir le repo LoRA principal pour la méthodologie complète, benchmarks, fonction de parsing JSON et format de prompt exact.

📊 Caractéristiques

CaractéristiqueValeur
Modèle de baseQwen 2.5-1.5B fine-tuné (LoRA mergé)
QuantizationQ4KM (4-bit)
Taille~986 MB
RAM nécessaire~1 GB
Vitesse CPU~20-30 tokens/sec sur laptop moderne
Vitesse GPU~80-120 tokens/sec

🚀 Utilisation avec Ollama

1. Télécharger le modèle

bash
wget https://huggingface.co/Sadou/medai-rural-qwen2.5-1.5b-gguf/resolve/main/qwen2.5-1.5b.Q4_K_M.gguf

2. Créer un Modelfile avec le VRAI prompt système

bash
cat > Modelfile <<'EOF'
FROM ./qwen2.5-1.5b.Q4_K_M.gguf

TEMPLATE """<|im_start|>system
{{ .System }}<|im_end|>
<|im_start|>user
{{ .Prompt }}<|im_end|>
<|im_start|>assistant
"""

SYSTEM """Tu es MedAI Rural, un assistant médical IA expert pour médecins en zone rurale
(Afrique francophone). On te fournit une question médicale et un ou plusieurs
passages issus d'un corpus médical de référence (Guides MSF).

Tu dois :
1. Analyser les passages fournis et identifier ceux qui sont pertinents
2. Générer une réponse clinique précise basée EXCLUSIVEMENT sur les passages pertinents
3. Citer les passages utilisés dans ta réponse (ex: \"Selon [1], ...\")
4. Ignorer les passages non pertinents

RÉPONDS UNIQUEMENT EN JSON VALIDE."""

PARAMETER stop "<|im_end|>"
PARAMETER temperature 0.1
PARAMETER num_predict 400
EOF

3. Importer dans Ollama

bash
ollama create medai-rural -f Modelfile

4. Tester

bash
ollama run medai-rural "Question: Quand dois-je référer un patient présentant des effets secondaires graves au traitement antituberculeux?

Passages disponibles:
[1] [Chapitre 10 : multirésistante et résistante à la > 10.7 Effets indésirables] [Section] Chapitre 10 : multirésistante et résistante à la > 10.7 Effets indésirables

Les effets indésirables peuvent apparaître à tout moment au cours du traitement..."

⚠️ Format important : la question doit commencer par Question: et les passages par Passages disponibles: (cf. le repo LoRA pour le format exact).

⚠️ Parsing JSON

Le modèle peut générer du texte parasite après le JSON. Utilisez TOUJOURS un parser robuste (voir le repo LoRA pour la fonction extract_first_json()).

🚀 Utilisation avec llama.cpp

bash
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make

./llama-cli \
    --model qwen2.5-1.5b.Q4_K_M.gguf \
    --chat-template chatml \
    --temp 0.1 \
    -n 400 \
    -p "..."  # Avec le format Question: + Passages disponibles:

⚠️ Limitations

⚠️ Modèle destiné à la recherche uniquement. PAS d'usage clinique sans validation médicale.

Voir le repo LoRA pour la liste complète des limitations.

⚖️ Licence

CC-BY-NC-4.0 — Usage non commercial uniquement.