CoolFace
Apppublic

wuhp/Qwen3.6-35B-A3B-MTP-GGUFtest

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
0likes
App README

Qwen3.6-35B-A3B served via llama.cpp (b9222) with Multi-Token Prediction speculative decoding.

  • —Model: unsloth/Qwen3.6-35B-A3B-MTP-GGUF @ UD-Q2KXL (~12.6 GB)
  • —MTP: --spec-type draft-mtp --spec-draft-n-max 2
  • —KV cache: q80 keys / iq4nl values
  • —Context: 4096 tokens
  • —Hardware: CPU Basic (2 vCPU / 16 GB RAM)

OpenAI-compatible API on port 7860.