CoolFace
Modelpublic

a-ivanovitch/Qwen3-4B-Instruct-2507-GGUF

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
1likes2kdownloads
Model Card

Qwen3-4B-Instruct-2507 GGUF (imatrix)

Versione GGUF ottimizzata di Qwen3-4B-Instruct, quantizzata da Sophia-AI con importance matrix (imatrix) per inferenza efficiente su GPU consumer e dispositivi edge.

Questi sono i modelli ufficiali utilizzati su **Sophia Metal** โ€” la nostra piattaforma di AI edge computing.

๐Ÿง  Quantizzazione con imatrix: a differenza delle quantizzazioni standard, queste utilizzano una importance matrix generata su un dataset di calibrazione multilingue e multi-task. Questo preserva i pesi piรน critici del modello durante la compressione, con miglioramenti significativi soprattutto su Q2K e Q3K_M.

๐Ÿ“ฆ File disponibili

FileQuantDimensioneScoreConsigliato per
Qwen3-4B-Instruct-2507-F16.ggufF167.5 GB8/8 โœ…Massima qualitร  / Fine-tuning
Qwen3-4B-Instruct-2507-Q8_0.ggufQ8_04.0 GB8/8 โœ…GPU con 8+ GB VRAM
Qwen3-4B-Instruct-2507-Q6_K.ggufQ6_K3.1 GB8/8 โœ…GPU con 6+ GB VRAM
Qwen3-4B-Instruct-2507-Q5_K_M.ggufQ5KM2.7 GB8/8 โœ…GPU con 6+ GB VRAM
Qwen3-4B-Instruct-2507-Q4_K_M.ggufQ4KM2.4 GB8/8 โœ…โญ Best balance โ€” GPU 4+ GB
Qwen3-4B-Instruct-2507-Q3_K_M.ggufQ3KM1.9 GB8/8 โœ…๐Ÿ”ฅ Sophia Metal / Edge 8GB
Qwen3-4B-Instruct-2507-Q2_K.ggufQ2_K1.6 GB8/8 โœ…Edge devices < 6GB

Tutti i quant passano 8/8 test funzionali โ€” tool calling, JSON output, codice, italiano โ€” senza degradazione rispetto a F16.


๐Ÿง  Perchรฉ imatrix?

La quantizzazione standard tratta tutti i pesi del modello allo stesso modo: li comprime uniformemente. Questo funziona bene per Q8 e Q6, ma a livelli aggressivi (Q3, Q2) i pesi critici per tool calling, JSON strutturato e ragionamento multilingue vengono compressi troppo.

L'importance matrix (imatrix) risolve questo problema:

  1. 1.Eseguiamo un forward pass del modello F16 su un dataset di calibrazione rappresentativo
  2. 2.Misuriamo quali pesi si attivano maggiormente (= sono piรน importanti)
  3. 3.Durante la quantizzazione, i pesi importanti vengono compressi meno, quelli meno importanti di piรน

Il risultato: Q2_K con imatrix mantiene capacitร  che senza imatrix sarebbero perse.

Dataset di calibrazione

Il nostro dataset รจ stato costruito specificamente per riflettere i casi d'uso reali di Sophia Metal:

SezioneContenutoScopo
๐Ÿ‡ฎ๐Ÿ‡น Italiano (~30%)Articoli Wikipedia italianiPreservare capacitร  multilingue
๐Ÿ‡ฌ๐Ÿ‡ง Inglese (~30%)WikiText (train + valid + test)Baseline linguistica
๐Ÿ’ป Codice (~20%)Python, JavaScript/Next.js, SQL, bash, YAMLPreservare generazione codice
๐Ÿ”ง Chat + Tools (~20%)Conversazioni Qwen3 con tool calling, JSON output, multi-turnPreservare tool calling e output strutturato

La sezione Chat + Tools รจ quella piรน critica: include esempi reali di <tool_call>, risposte JSON strutturate, tool definitions nei system prompt, parallel tool calls e conversazioni multi-turn. Senza questi pattern nel dataset di calibrazione, i pesi responsabili della generazione di {"name": "get_weather", "arguments": ...} verrebbero identificati come poco importanti e compressi troppo.


โœ… Test di qualitร 

Tutti i quant sono stati testati con una suite automatizzata che verifica le capacitร  core per l'uso in produzione:

Test                          F16   Q8_0  Q6_K  Q5_K_M Q4_K_M Q3_K_M Q2_K
โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€
JSON output semplice          โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
Tool call - singolo           โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
Tool call - multiplo          โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
Tool call - scelta tool       โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
Tool follow-up                โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
Italiano - coerenza           โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
Codice Python                 โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
JSON strutturato complesso    โœ…    โœ…    โœ…    โœ…     โœ…     โœ…     โœ…
โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€โ”€
Score                         8/8   8/8   8/8   8/8    8/8    8/8    8/8

I test verificano:

  • โ€”Tool calling nativo (singolo, multiplo, selezione del tool corretto)
  • โ€”Tool follow-up (interpretazione della risposta JSON del tool)
  • โ€”JSON output (semplice e strutturato complesso con nested arrays)
  • โ€”Italiano (coerenza linguistica)
  • โ€”Codice (generazione Python con logica corretta)

๐ŸŽฏ Quale scegliere?

๐Ÿ–ฅ๏ธ Desktop / Server GPU

La tua VRAMModello consigliatoNote
24 GB+Q80 o Q6KMassima qualitร 
12-16 GBQ6K o Q5K_MOttimo compromesso
8 GBQ4_K_M โญSweet spot
6 GBQ4KM o Q3KMBuone performance
4 GBQ3KMFunziona bene

๐Ÿ”ฅ Sophia Metal / Edge Computing (8GB unified memory)

Per dispositivi edge con memoria unificata (come Sophia Metal):

SetupModelloNote
Solo LLMQ3_K_M โญConsigliato
LLM + Embeddings + DBQ3_K_MStack completo
Memoria criticaQ2_KFunziona bene grazie a imatrix
๐Ÿ’ก Sophia Metal usa Q3KM come default per garantire spazio a tutto lo stack (LLM + embeddings + vector DB + app). Con imatrix, anche Q2_K รจ un'opzione valida per scenari a memoria molto limitata.

๐Ÿ’ป CPU Only

RAM disponibileModello
16 GB+Q4KM
8-12 GBQ3KM
< 8 GBQ2_K

๐Ÿ“ฅ Download

bash
# โญ Consigliato per la maggior parte degli utenti
huggingface-cli download Sophia-AI/Qwen3-4B-Instruct-2507-GGUF \
    Qwen3-4B-Instruct-2507-Q4_K_M.gguf

# ๐Ÿ”ฅ Per Sophia Metal / Edge devices
huggingface-cli download Sophia-AI/Qwen3-4B-Instruct-2507-GGUF \
    Qwen3-4B-Instruct-2507-Q3_K_M.gguf

# Massima qualitร 
huggingface-cli download Sophia-AI/Qwen3-4B-Instruct-2507-GGUF \
    Qwen3-4B-Instruct-2507-Q6_K.gguf

๐Ÿš€ Utilizzo

llama-cpp-python

python
from llama_cpp import Llama

llm = Llama.from_pretrained(
    repo_id="Sophia-AI/Qwen3-4B-Instruct-2507-GGUF",
    filename="*Q4_K_M.gguf",
    n_ctx=4096,
    n_gpu_layers=-1,  # -1 = tutte le layers su GPU
)

response = llm.create_chat_completion(
    messages=[
        {"role": "user", "content": "Ciao, come stai?"}
    ]
)
print(response["choices"][0]["message"]["content"])

Tool calling

python
response = llm.create_chat_completion(
    messages=[
        {"role": "user", "content": "What's the weather in Rome?"}
    ],
    tools=[{
        "type": "function",
        "function": {
            "name": "get_weather",
            "description": "Get weather for a city",
            "parameters": {
                "type": "object",
                "properties": {
                    "city": {"type": "string"}
                },
                "required": ["city"]
            }
        }
    }]
)

llama.cpp CLI

bash
./llama-cli -m Qwen3-4B-Instruct-2507-Q4_K_M.gguf \
    -p "<|im_start|>user\nCiao!<|im_end|>\n<|im_start|>assistant\n" \
    -n 256 -ngl 99

Ollama

bash
ollama run hf.co/Sophia-AI/Qwen3-4B-Instruct-2507-GGUF:Q4_K_M

๐Ÿ“Š Specifiche modello

ParametroValore
Parametri4.02B
Context length262,144 tokens
ArchitetturaQwen3
Vocab size151,936
Layers36
Attention heads32

๐Ÿ”ง Dettagli quantizzazione

ParametroValore
SorgenteQwen3-4B-Instruct-2507 F16 (convertito da HuggingFace safetensors)
Toolllama.cpp llama-quantize con --imatrix
imatrixGenerata con llama-imatrix, chunk size 512
Calibration dataset~10MB, multilingue (IT/EN), codice (Python/JS/SQL/bash), chat Qwen3 con tool calling
GPU per imatrixNVIDIA (full GPU offload)

๐Ÿ”— Links


๐Ÿ“œ Licenza

Apache 2.0 โ€” Stesso del modello base Qwen3.


๐Ÿ™ Crediti