CoolFace
Modelpublic

dervig/m51Lab-NorskMistral-119B-GGUF

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes36downloads
Model Card

m51Lab-NorskMistral-119B-GGUF

GGUF-kvantiserte versjoner av m51Lab-NorskMistral-119B.

Tilgjengelige filer

FilKvantiseringStørrelseBeskrivelse
m51Lab-NorskMistral-119B-Q4_K_M.ggufQ4KM68 GBStandard versjon, 4.85 bits per weight
m51Lab-NorskMistral-119B-thinking-Q4_K_M.ggufQ4KM68 GBMed thinking/reasoning aktivert (chain-of-thought)

Forskjell mellom standard og thinking

  • —Standard: Svarer direkte. Raskere, enklere svar.
  • —Thinking: Modellen resonnerer steg-for-steg i en skjult <think>-blokk før den svarer. Gir bedre svar på logikk- og resonneringsspørsmål, men bruker flere tokens.

Bruk med llama.cpp

bash
# Standard
llama-server -m m51Lab-NorskMistral-119B-Q4_K_M.gguf -ngl 99 -fa off --host 0.0.0.0 --port 8080

# Thinking
llama-server -m m51Lab-NorskMistral-119B-thinking-Q4_K_M.gguf -ngl 99 -fa off --host 0.0.0.0 --port 8080 \
  --reasoning on --reasoning-budget 4096 --reasoning-format deepseek

Åpne http://localhost:8080 i nettleseren for det innebygde chat-grensesnittet.

Bruk med Ollama

bash
# Lag en Modelfile
cat > Modelfile << 'EOF'
FROM m51Lab-NorskMistral-119B-Q4_K_M.gguf
PARAMETER num_gpu 99
EOF

ollama create m51-norskmistral -f Modelfile
ollama run m51-norskmistral

NorEval-resultater

OppgaveResultatNorEval #1
Commonsense-resonnering (BM)75.7%72.2%
Commonsense-resonnering (NN)63.2%52.6%
Open-book QA (BM)95.7%87.4%
Open-book QA (NN)93.3%88.9%
Truthfulness (BM)77.9%74.6%
Truthfulness (NN)82.5%73.7%
Norsk kunnskap (BM)66.5%63.7%
Norsk kunnskap (NN)65.1%71.9%
Gjennomsnitt76.8%73.1%

Hardware-krav

OppsettVRAM/RAMYtelse
2x H100 80GB160 GB VRAM154 tok/s generering
1x H100 80GB80 GB VRAMFungerer men tight, delvis CPU fallback
Mac M2/M3/M4 Max 128GB128 GB unifiedBør fungere, ca 5-15 tok/s
Mac M2/M3/M4 Ultra 192GB192 GB unifiedKomfortabelt, ca 10-20 tok/s

Viktig: MoE-arkitekturen (128 eksperter) krever at alle vekter ligger i minne, selv om bare 4 eksperter er aktive per token. Minimum ~70 GB RAM/VRAM for Q4KM.

Tekniske detaljer

  • —Arkitektur: Mistral Small 4 119B MoE (128 eksperter, 4 aktive)
  • —Kvantisering: Q4KM via llama.cpp (build b8680)
  • —Bits per weight: 4.85
  • —Flash attention: Deaktivert (broken for Mistral4 på CUDA/Metal, bruk -fa off)

Kreditering

Lisens

Apache 2.0 (samme som base-modellen)

Om m51

Bygget av m51.ai.