CoolFace
Modelpublic

madcatlab/Qwen3.5-4B-Marketing-GGUF

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes26downloads
Model Card

Qwen3.5-4B-Marketing-GGUF

madcatlab/Qwen3.5-4B-Marketing modelinin llama.cpp / GGUF formatına dönüştürülmüş hali. Mad Cat Lab tarafından dijital pazarlama ve marketing mix diyalogları için ince ayarlanmıştır.

AlanDeğer
Kaynak modelmadcatlab/Qwen3.5-4B-Marketing
Taban mimariunsloth/Qwen3.5-4B (qwen3_5)
QuantizationQ4_K_M
Dosya boyutu2.6G
LisansApache-2.0
DillerTürkçe, İngilizce

Dosya

DosyaQuantBoyut
qwen-madcatlabs-4b-Q4_K_M.ggufQ4KM2.6G
Q4_K_M saf 4-bit değildir: K-quant reçetesinde attn_v ve ffn_down tensörleri daha yüksek hassasiyette bırakılır, ortalama ~4.7 bit/parametre olur.

Donanım gereksinimi

Model GPU gerektirmez, CPU'da çalışır. Katmanların yalnızca ¼'ü full-attention, kalanı lineer dikkat olduğu için KV cache olağandışı küçüktür (token başına ~32 KB).

BağlamKV cacheToplam RAM
4K0.13 GB~3.4 GB
16K0.54 GB~3.8 GB
32K1.07 GB~4.3 GB
128K4.29 GB~7.5 GB

8 GB RAM'li bir makinede 16K bağlamla rahat çalışır.

--cache-type-k q8_0 --cache-type-v q8_0 ile KV cache yarıya iner.

Ölçülen hız (Apple M4 Max, saf CPU, -dev none)

ThreadPrompt işlemeToken üretimi
4101 t/s36.1 t/s
8172 t/s52.4 t/s
12155 t/s25.8 t/s
Thread sayısını fiziksel performans çekirdeği sayısıyla sınırlayın. Verimlilik çekirdeklerine taşmak senkronizasyon nedeniyle üretimi yavaşlatır. Token üretimi bellek bant genişliğine bağlıdır. Tipik bir DDR5 dizüstünde (~90 GB/s) yaklaşık 11 t/s beklenir — okuma hızının üzerinde.

⚠️ Önemli: enable_thinking=false zorunlu

Bu model <think> bloğunu açar ama kapatmaz — cevabın tamamı kapanmamış düşünce bloğunun içinde kalır. Varsayılan ayarlarla llama-server kullanırsanız OpenAI uyumlu yanıtta `content` alanı boş döner, metin reasoning_content alanına gider. Standart istemciler yalnızca content okuduğu için entegrasyon her istekte boş cevap alır.

Ölçülen davranış (/v1/chat/completions, aynı soru):

Ayar`content``reasoning_content`Sonuç
varsayılan0686❌ boş cevap
--reasoning-format none6190⚠️ <think> etiketi metne karışır
`--chat-template-kwargs '{"enable_thinking":false}'`5100✅ temiz

Chat template enable_thinking false iken önceden kapatılmış boş blok (<think>\n\n</think>) yazar ve model cevabı doğrudan içerik olarak üretir.

Kullanım

llama.cpp — sunucu (önerilen)

bash
llama-server -m qwen-madcatlabs-4b-Q4_K_M.gguf -c 16384 -t 8 \
  --chat-template-kwargs '{"enable_thinking":false}' \
  --cache-type-k q8_0 --cache-type-v q8_0 --port 8080

llama.cpp — CLI

bash
llama-cli -m qwen-madcatlabs-4b-Q4_K_M.gguf -c 16384 -t 8 \
  --chat-template-kwargs '{"enable_thinking":false}' \
  -sys "Sen dijital pazarlama uzmanısın."

Ollama

bash
ollama create Qwen3.5-4B-Marketing -f Modelfile
ollama run Qwen3.5-4B-Marketing

Kullanım amacı ve sınırlar

  • —Türkçe/İngilizce pazarlama, reklam, SEO ve strateji odaklı soru-cevap.
  • —Sistem prompt'u ile asistan/chatbot senaryolarında kullanım.
  • —Üretilen metinler doğrulanmadan yasal, finansal veya kritik iş kararlarında kullanılmamalıdır.
  • —Güncel platform politikaları ve rakamsal gerçekler için harici doğrulama gerekir.
  • —Quantization, ince ayarın kattığı ton/format davranışında küçük kayıplara yol açabilir. Hassasiyet öncelikliyse Q5_K_M veya Q6_K tercih edin.

Atıf

bibtex
@misc{madcatlab_qwen35_4b_marketing_gguf,
  title        = { Qwen3.5-4B-Marketing-GGUF },
  author       = {madcatlab},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/madcatlab/Qwen3.5-4B-Marketing}},
  note         = {GGUF conversion of a LoRA fine-tune of unsloth/Qwen3.5-4B}
}