webbrain-one/gemma4-turkish-26b-a4b-pruned-gguf
3431
Gemma 4 26B-A4B Pruned + Türkçe Heal — GGUF
google/gemma-4-26B-A4B-it modelinin uzman-budanmış (expert-pruned) ve Türkçeye uyarlanmış versiyonu. Her katmandaki 128 uzmandan 101'i korundu (~%21 küçülme), ardından Türkçe + kod + matematik karışık talimat veriseti üzerinde LoRA ile iyileştirildi.
llama.cpp / Ollama / LM Studio ile RTX 5060 (16 GB) veya benzeri tüketici GPU'larda kolayca çalışır.
Sürümler
Kullanım
llama.cpp
./llama-cli -m merged.Q4_K_M.gguf \
-p "Türkiye'nin başkenti neresidir?" \
-n 200 --temp 0.7 --repeat-penalty 1.1Ollama
cat > Modelfile <<'MODELFILE'
FROM ./merged.Q4_K_M.gguf
TEMPLATE """{{ if .System }}<start_of_turn>system
{{ .System }}<end_of_turn>
{{ end }}{{ if .Prompt }}<start_of_turn>user
{{ .Prompt }}<end_of_turn>
<start_of_turn>model
{{ end }}{{ .Response }}<end_of_turn>
"""
PARAMETER stop "<end_of_turn>"
PARAMETER repeat_penalty 1.1
SYSTEM "Sen yardımsever, dürüst ve bilgili bir Türkçe konuşan asistansın. Kullanıcının sorusu hangi dilde olursa olsun her zaman Türkçe yanıt ver."
MODELFILE
ollama create gemma-tr -f Modelfile
ollama run gemma-trEğitim Detayları
Sınırlamalar
- Matematik akıl yürütme (özellikle çok adımlı problemler) zayıf
- 4-bit quant nedeniyle bf16 versiyonuna kıyasla ~%1-2 perplexity artışı
- Türkçe-dışı dillerde yazılı talimatlara hâlâ Türkçe cevap verir (system prompt ile değiştirilebilir)
Gemma 4 26B-A4B Pruned + Turkish Heal — GGUF (English)
Expert-pruned variant of google/gemma-4-26B-A4B-it: 128 → 101 experts per layer (~21% smaller), then LoRA-healed on a Turkish + code + math instruction mix. Runs comfortably on RTX 5090 / 24 GB+ consumer GPUs via llama.cpp / Ollama / LM Studio.
Variants
Training summary
Limitations
- Multi-step math reasoning is weak
- ~1-2% perplexity increase vs bf16 due to 4-bit quantization
- Defaults to Turkish output; override via system prompt for other languages
