gatilin/Qwen3.6-35B-A3b-pruned-v2
22.2k
qwen3.6-35b-a3b-pruned-v2 · GGUF(含 llama.cpp 工具链,开箱即用)
Qwen3.6 35B-A3B 剪枝版(REAP 0.25)GGUF 量化模型,混合 SSM + Attention + MoE 架构, 配合 llama.cpp b10537(macOS ARM64 / Metal) 全套工具链打包发布——git clone / huggingface-cli download 拉取后无需编译、无需安装任何依赖,直接运行脚本即可启动 OpenAI 兼容服务。
亮点
- 开箱即用:仓库内自带
llama-server/llama-cli/llama-bench及全部 Metal 动态库(libggml*.dylib等),一键脚本零配置启动。 - 超长上下文:原生支持 262,144(256K)token 上下文。
- MoE 高效:192 专家每 token 仅激活 8 个(约 3B 激活参数),单机即可推理。
- 体积可控:15.15 GiB,Q3KM + Q4KS + F32 混合量化。
目录结构
qwen3.6-35b-a3b-pruned-v2-hf/
├── README.md # 本文件(HF 仓库主页)
├── README_HF.md # 内部上传步骤指引(团队)
├── qwen3.6-35b-a3b-pruned-v2.gguf # 模型权重(15.15 GiB)
├── bin/ # llama.cpp b10537 工具链(macOS ARM64 Metal)
│ ├── llama-server / llama-cli / llama-bench / llama-perplexity ...
│ └── libggml*.dylib / libllama*.dylib / libmtmd*.dylib ...
└── scripts/
├── run-server.sh # 一键启动 OpenAI 兼容 API 服务
└── run-cli.sh # 一键启动交互式命令行硬件要求
- 平台:macOS(Apple Silicon,ARM64),依赖 Metal 后端。
- 内存:建议 ≥ 32 GiB 统一内存;模型权重 15.15 GiB,另需 KV cache(256K 上下文下显著,请按内存下调
-c)。 - 非 macOS 平台可忽略
bin/,改用任意支持 GGUF 的 llama.cpp 构建自行加载权重。
快速开始(拉取后原地可跑)
1. 启动 OpenAI 兼容服务
cd qwen3.6-35b-a3b-pruned-v2-hf
./scripts/run-server.sh
# 默认: -ngl 99 -c 16384 --host 127.0.0.1 --port 8081常用覆盖:
PORT=9000 CONTEXT=32768 ./scripts/run-server.sh2. 交互式命令行
./scripts/run-cli.sh示例 curl(OpenAI 兼容)
curl http://127.0.0.1:8081/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b-a3b-pruned-v2",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "用一句话解释什么是 MoE 架构。"}
],
"temperature": 0.0,
"max_tokens": 512
}'健康检查:
curl http://127.0.0.1:8081/health模型信息
性能/Benchmark 摘要
详细报告见仓库配套文档(本 README 引用以下基准结论,均来自本地实测):A线 llama-native、B线 SWE-bench、C线 AgentSkills+GAIA评测。
注意:主体为 Q3KM 低比特量化,复杂推理/数学/代码的精度相比原始权重可能下降;GAIA 格式遵循偏弱为已知短板。
已知限制
qwen35moe为自定义混合架构,transformers支持未验证;推荐使用本仓库随附的 llama.cpp。- 256K KV cache 未量化,实际可用上下文受硬件内存限制(默认脚本用 16K)。
- 本仓为纯文本 GGUF,不含官方多模态(Vision)能力。
- 仅附带 macOS ARM64 / Metal 构建;其他平台请自行准备 llama.cpp。
引用
@misc{qwen35moe,
title = {Qwen3.6-35B-A3B},
author = {Qwen Team, Alibaba Cloud},
year = {2026},
url = {https://huggingface.co/Qwen/Qwen3.6-35B-A3B}
}