CoolFace
Modelpublic

kataguru/Apodex-1.1-mini-Finnish-GGUF

sourceHugging Faceapache-2.0updated 4d agoView on Hugging Face
0likes539downloads
Model Card

Apodex-1.1-mini-Finnish-GGUF

GGUF-kvantisoinnit Apodex-1.1-mini -monialamallista (36B MoE, 3B aktiivista parametria per token), varustettuna suoraan mallin metatietoihin integroidulla suomalaisella chat-templatella ja visioprojektorilla (mmproj).

Alkuperäinen malli: apodex/Apodex-1.1-mini


Mitä Kataguru muutti?

KenttäKuvaus
Base modelapodex/Apodex-1.1-mini
Katagurun muutosSuomalainen chat-template (Jinja2) + GGUF-kvantisointi (llama.cpp build b11064)
Mitä EI muutettuMallin arkkitehtuuri, esikoulutetut painot tai sanasto
Ensisijainen käyttöPaikallinen suomenkielinen päättely ja monialakäyttö vähäisellä muistinkäytöllä
Suositeltu versioQ4_K_M (20.2 GiB) tai IQ4_XS (18.0 GiB)
Testattu laitteistoRTX 5090 32GB / llama-bench b11064

Arkkitehtuuri ja Ominaisuudet

  • —Sparse MoE (3B aktiivista / 36B kokonaiskoko): 8 aktiivista asiantuntijaa 256:sta per token. Mahdollistaa pienen 3B-mallin laskennallisen läpimenon suuremman mallin tietomäärällä.
  • —Hybridi-Attention: 30 Linear Attention (GDN) -kerrosta ja 10 Full Attention -kerrosta.
  • —Konteksti-ikkuna: 262 144 tokenia (teoreettinen arkkitehtuurimaksimi).
  • —Natiivi visio & OCR: Toimitetaan erillisen visioprojektorin (mmproj-Apodex-1.1-mini-Finnish-BF16.gguf) kanssa kuvien ja asiakirjojen lukemiseen suomeksi.
  • —Päättelysyvyys (`<think>`): Malli tukee sisäistä päättelyketjua ja ohjattavia päättelytasoja ({REASON:spoon}, {REASON:einstein}, {REASON:none}).

Suorituskykymittaukset (llama-bench)

Mittaustulokset ajettu suoraan NVIDIA GeForce RTX 5090 32GB -kortilla (CUDA Backend, Flash Attention on):

Malli / KvanttiTiedostokokoVRAM-vaatimusPrompt Eval (`pp512`)Generointinopeus (`tg128`)Laitteistosuositus
`Apodex-1.1-mini-Finnish-Q3_K_M.gguf`15.98 GiB~16.5 GB6 836.6 tok/s253.8 tok/s16–24 GB VRAM (RTX 4080, 5080, Mac 16GB+)
`Apodex-1.1-mini-Finnish-IQ4_XS.gguf`18.05 GiB~18.6 GB6 628.3 tok/s263.5 tok/s20–24 GB VRAM (RTX 3090, 4090, 5090)
`Apodex-1.1-mini-Finnish-Q4_K_M.gguf`20.21 GiB~21.0 GB6 586.3 tok/s262.6 tok/s24 GB+ VRAM (RTX 3090, 4090, 5090)
`Apodex-1.1-mini-Finnish-Q5_K_M.gguf`24.10 GiB~25.0 GB~6 400 tok/s~255 tok/s32 GB+ VRAM / Jaettu muisti
`Apodex-1.1-mini-Finnish-Q6_K.gguf`28.20 GiB~29.5 GB~6 200 tok/s~250 tok/s32 GB+ VRAM
`mmproj-Apodex-1.1-mini-Finnish-BF16.gguf`861 MiB+0.9 GBN/AN/AVisioprojektori OCR- ja kuva-ajoon

Havainnot ja Tunnetut Rajoitukset

  1. 1.Suomen kielen laatu: Integroidun chat-templaten ansiosta malli käsittelee suomalaiset sijamuodot ja ammattikielen huomattavasti alkuperäistä peruskehotetta paremmin.
  2. 2.MoE-arkkitehtuurin rajoitukset: Koska kerrallaan aktivoituu vain 3B parametria, monivaiheisissa loogisissa pulmassa tai syvällisessä koodauksessa mallin päättelyvarmuus jää alle tiheiden 27B-mallien (kuten Titan).
  3. 3.Kontekstimuisti: Vaikka malli tukee 262k tokenia, yli 32k kontekstit kasvattavat KV-cachen muistinvarausta merkittävästi.

Käyttöohjeet

LM Studio

  1. 1.Lataa .gguf-tiedosto (esim. Apodex-1.1-mini-Finnish-Q4_K_M.gguf) ja visioprojektori mmproj-Apodex-1.1-mini-Finnish-BF16.gguf.
  2. 2.Sijoita kansioon: ~/.lmstudio/models/kataguru/Apodex-1.1-mini-Finnish-GGUF/
  3. 3.Malli tunnistaa suomalaisen chat-templaten ja visiotuen automaattisesti. Suositeltu lämpötila: 0.6.

llama-cli

bash
llama-cli \
  -m Apodex-1.1-mini-Finnish-Q4_K_M.gguf \
  --mmproj mmproj-Apodex-1.1-mini-Finnish-BF16.gguf \
  -ngl 99 \
  -fa on \
  -c 8192 \
  -p "Miten kvanttitietokone eroaa klassisesta tietokoneesta?"

Lisenssi

Pohjamalli: apodex/Apodex-1.1-mini (Apache 2.0). Chat-template ja GGUF-julkaisu: Kataguru.