wuhp/Qwen3.6-35B-A3B-MTP-GGUFtest
0
Qwen3.6-35B-A3B served via llama.cpp (b9222) with Multi-Token Prediction speculative decoding.
- Model:
unsloth/Qwen3.6-35B-A3B-MTP-GGUF@ UD-Q2KXL (~12.6 GB) - MTP:
--spec-type draft-mtp --spec-draft-n-max 2 - KV cache: q80 keys / iq4nl values
- Context: 4096 tokens
- Hardware: CPU Basic (2 vCPU / 16 GB RAM)
OpenAI-compatible API on port 7860.
