madcatlab/Qwen3.5-4B-Marketing-GGUF
Qwen3.5-4B-Marketing-GGUF
madcatlab/Qwen3.5-4B-Marketing modelinin llama.cpp / GGUF formatına dönüştürülmüş hali. Mad Cat Lab tarafından dijital pazarlama ve marketing mix diyalogları için ince ayarlanmıştır.
Dosya
Q4_K_Msaf 4-bit değildir: K-quant reçetesindeattn_vveffn_downtensörleri daha yüksek hassasiyette bırakılır, ortalama ~4.7 bit/parametre olur.
Donanım gereksinimi
Model GPU gerektirmez, CPU'da çalışır. Katmanların yalnızca ¼'ü full-attention, kalanı lineer dikkat olduğu için KV cache olağandışı küçüktür (token başına ~32 KB).
8 GB RAM'li bir makinede 16K bağlamla rahat çalışır.
--cache-type-k q8_0 --cache-type-v q8_0 ile KV cache yarıya iner.
Ölçülen hız (Apple M4 Max, saf CPU, -dev none)
Thread sayısını fiziksel performans çekirdeği sayısıyla sınırlayın. Verimlilik çekirdeklerine taşmak senkronizasyon nedeniyle üretimi yavaşlatır. Token üretimi bellek bant genişliğine bağlıdır. Tipik bir DDR5 dizüstünde (~90 GB/s) yaklaşık 11 t/s beklenir — okuma hızının üzerinde.
⚠️ Önemli: enable_thinking=false zorunlu
Bu model <think> bloğunu açar ama kapatmaz — cevabın tamamı kapanmamış düşünce bloğunun içinde kalır. Varsayılan ayarlarla llama-server kullanırsanız OpenAI uyumlu yanıtta `content` alanı boş döner, metin reasoning_content alanına gider. Standart istemciler yalnızca content okuduğu için entegrasyon her istekte boş cevap alır.
Ölçülen davranış (/v1/chat/completions, aynı soru):
Chat template enable_thinking false iken önceden kapatılmış boş blok (<think>\n\n</think>) yazar ve model cevabı doğrudan içerik olarak üretir.
Kullanım
llama.cpp — sunucu (önerilen)
llama-server -m qwen-madcatlabs-4b-Q4_K_M.gguf -c 16384 -t 8 \
--chat-template-kwargs '{"enable_thinking":false}' \
--cache-type-k q8_0 --cache-type-v q8_0 --port 8080llama.cpp — CLI
llama-cli -m qwen-madcatlabs-4b-Q4_K_M.gguf -c 16384 -t 8 \
--chat-template-kwargs '{"enable_thinking":false}' \
-sys "Sen dijital pazarlama uzmanısın."Ollama
ollama create Qwen3.5-4B-Marketing -f Modelfile
ollama run Qwen3.5-4B-MarketingKullanım amacı ve sınırlar
- Türkçe/İngilizce pazarlama, reklam, SEO ve strateji odaklı soru-cevap.
- Sistem prompt'u ile asistan/chatbot senaryolarında kullanım.
- Üretilen metinler doğrulanmadan yasal, finansal veya kritik iş kararlarında kullanılmamalıdır.
- Güncel platform politikaları ve rakamsal gerçekler için harici doğrulama gerekir.
- Quantization, ince ayarın kattığı ton/format davranışında küçük kayıplara yol açabilir. Hassasiyet öncelikliyse
Q5_K_MveyaQ6_Ktercih edin.
Atıf
@misc{madcatlab_qwen35_4b_marketing_gguf,
title = { Qwen3.5-4B-Marketing-GGUF },
author = {madcatlab},
year = {2026},
howpublished = {\url{https://huggingface.co/madcatlab/Qwen3.5-4B-Marketing}},
note = {GGUF conversion of a LoRA fine-tune of unsloth/Qwen3.5-4B}
}