dervig/m51Lab-NorskMistral-119B-GGUF
036
m51Lab-NorskMistral-119B-GGUF
GGUF-kvantiserte versjoner av m51Lab-NorskMistral-119B.
Tilgjengelige filer
Forskjell mellom standard og thinking
- Standard: Svarer direkte. Raskere, enklere svar.
- Thinking: Modellen resonnerer steg-for-steg i en skjult
<think>-blokk før den svarer. Gir bedre svar på logikk- og resonneringsspørsmål, men bruker flere tokens.
Bruk med llama.cpp
# Standard
llama-server -m m51Lab-NorskMistral-119B-Q4_K_M.gguf -ngl 99 -fa off --host 0.0.0.0 --port 8080
# Thinking
llama-server -m m51Lab-NorskMistral-119B-thinking-Q4_K_M.gguf -ngl 99 -fa off --host 0.0.0.0 --port 8080 \
--reasoning on --reasoning-budget 4096 --reasoning-format deepseekÅpne http://localhost:8080 i nettleseren for det innebygde chat-grensesnittet.
Bruk med Ollama
# Lag en Modelfile
cat > Modelfile << 'EOF'
FROM m51Lab-NorskMistral-119B-Q4_K_M.gguf
PARAMETER num_gpu 99
EOF
ollama create m51-norskmistral -f Modelfile
ollama run m51-norskmistralNorEval-resultater
Hardware-krav
Viktig: MoE-arkitekturen (128 eksperter) krever at alle vekter ligger i minne, selv om bare 4 eksperter er aktive per token. Minimum ~70 GB RAM/VRAM for Q4KM.
Tekniske detaljer
- Arkitektur: Mistral Small 4 119B MoE (128 eksperter, 4 aktive)
- Kvantisering: Q4KM via llama.cpp (build b8680)
- Bits per weight: 4.85
- Flash attention: Deaktivert (broken for Mistral4 på CUDA/Metal, bruk
-fa off)
Kreditering
- Base-modell: Mistral Small 4 av Mistral AI, Apache 2.0
- NorEval-benchmark: NorEval: A Comprehensive Benchmark for Norwegian Language Models av Language Technology Group, Universitetet i Oslo (ACL 2025)
- Treningsdata: Se LoRA-repoen for fullstendig liste
- GGUF-konvertering: llama.cpp av Georgi Gerganov et al.
Lisens
Apache 2.0 (samme som base-modellen)
Om m51
Bygget av m51.ai.
