shaban2024/Qwen3.5-4B-BOS-Q8-NonThinking
AgentMujo Q8 4B v0.1 (joint-03) — veci bosanski Linux agent
Prva 4B verzija: baza Qwen3.5-4B-bos (~3.2B) + LoRA joint-01→03 (SFT mix, joint_train), merge, GGUF Q8_0. Jedan GGUF za oba profila (think: true/false). Ista metodologija kao 2B v0.5, veci kapacitet.
- Baza:
alphaedge-ai/Qwen3.5-4B-bos-32768@34a62191(Apache-2.0, hidden 2560, 32 sloja, vocab 32768) - Trening: LoRA r16/alpha32, bf16, Kaggle T4; joint-01 eval 0.883, joint-02 eval 0.815, joint-03 eval 0.777; framework repo
- Dataseti: isti kao 2B (FC + AG + BC + thinking, mix v0.27)
- Kvantizacija: llama.cpp
convert_hf_to_gguf.py --no-mtp+Q8_0(~3.9 GB,qwen35.block_count=32)
Upotreba (Ollama)
ollama create agentmujo-4b-q8 -f Modelfile
ollama run agentmujo-4b-q8 "Radi li nginx servis?"Benchmark (AgentMujo-Bench v0.5, 48 slučajeva, Q8, temp 0, nonthink)
4B joint-03 vs 2B v0.5 (produkcijski prompt):
Baza-2B referenca: toolselection 0.143, argumentaccuracy 0.0. 6 pobjeda, 3 tiea, 1 gubitak (high_level: jedan terminal-slucaj) — 4B je tacniji agent od 2B v0.5; 2B ostaje efikasniji default (1.5GB).
Agent loop (model+policy+executor, 48 slucajeva): tasksuccess **1.0**, safety/refusal/notool/args 1.0; tool 0.70, conf 1.0, high 0.2. Bosanska proba: heuristika 12/12; proza mjesovita (ekavizam "Srećan", "Servis" umjesto "Server"). Think-profil (mjereno 09-2026): 4W-2T-2L vs v0.4-think (conf/notool/ refusal/multi bolji; tool/args/safety slabiji) — jedini safety-fail je /etc/shadow u think rezimu. Think produkcija ostaje v0.4-think.
Ograničenja
Prva 4B verzija: high_level slabiji od 2B v0.5; proza mjestimično slabija; think safety na /etc/shadow (policy deny kao zadnja linija). Terminal je fallback — Policy Engine obavezan.
Licenca
Apache-2.0 (baza + framework).
