CoolFace
Modelpublic

gatilin/Qwen3.6-35B-A3b-pruned-v2

sourceHugging Faceapache-2.0updated 15d agoView on Hugging Face
2likes2.2kdownloads
Model Card

qwen3.6-35b-a3b-pruned-v2 · GGUF(含 llama.cpp 工具链,开箱即用)

Qwen3.6 35B-A3B 剪枝版(REAP 0.25)GGUF 量化模型,混合 SSM + Attention + MoE 架构, 配合 llama.cpp b10537(macOS ARM64 / Metal) 全套工具链打包发布——git clone / huggingface-cli download 拉取后无需编译、无需安装任何依赖,直接运行脚本即可启动 OpenAI 兼容服务。

亮点

  • —开箱即用:仓库内自带 llama-server / llama-cli / llama-bench 及全部 Metal 动态库(libggml*.dylib 等),一键脚本零配置启动。
  • —超长上下文:原生支持 262,144(256K)token 上下文。
  • —MoE 高效:192 专家每 token 仅激活 8 个(约 3B 激活参数),单机即可推理。
  • —体积可控:15.15 GiB,Q3KM + Q4KS + F32 混合量化。

目录结构

qwen3.6-35b-a3b-pruned-v2-hf/
├── README.md                          # 本文件(HF 仓库主页)
├── README_HF.md                       # 内部上传步骤指引(团队)
├── qwen3.6-35b-a3b-pruned-v2.gguf     # 模型权重(15.15 GiB)
├── bin/                               # llama.cpp b10537 工具链(macOS ARM64 Metal)
│   ├── llama-server / llama-cli / llama-bench / llama-perplexity ...
│   └── libggml*.dylib / libllama*.dylib / libmtmd*.dylib ...
└── scripts/
    ├── run-server.sh                  # 一键启动 OpenAI 兼容 API 服务
    └── run-cli.sh                     # 一键启动交互式命令行

硬件要求

  • —平台:macOS(Apple Silicon,ARM64),依赖 Metal 后端。
  • —内存:建议 ≥ 32 GiB 统一内存;模型权重 15.15 GiB,另需 KV cache(256K 上下文下显著,请按内存下调 -c)。
  • —非 macOS 平台可忽略 bin/,改用任意支持 GGUF 的 llama.cpp 构建自行加载权重。

快速开始(拉取后原地可跑)

1. 启动 OpenAI 兼容服务

bash
cd qwen3.6-35b-a3b-pruned-v2-hf
./scripts/run-server.sh
# 默认: -ngl 99 -c 16384 --host 127.0.0.1 --port 8081

常用覆盖:

bash
PORT=9000 CONTEXT=32768 ./scripts/run-server.sh

2. 交互式命令行

bash
./scripts/run-cli.sh

示例 curl(OpenAI 兼容)

bash
curl http://127.0.0.1:8081/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b-a3b-pruned-v2",
    "messages": [
      {"role": "system", "content": "You are a helpful assistant."},
      {"role": "user", "content": "用一句话解释什么是 MoE 架构。"}
    ],
    "temperature": 0.0,
    "max_tokens": 512
  }'

健康检查:

bash
curl http://127.0.0.1:8081/health

模型信息

属性值
基础模型Qwen/Qwen3.6-35B-A3B(Apache-2.0)
架构qwen35moe(SSM + Attention + MoE),40 层
参数总量26,602,304,128 ≈ 26.60B(实测)
激活参数~3B(每 token 激活 8/192 专家)
上下文长度262,144(255K+,实测)
量化GGUF v3 混合量化:Q3KM 主体 + Q4KS 投影 + F32 门控/归一化
文件大小16,269,908,320 字节(15.15 GiB)
SHA-256c6afa34954c5e3abcc492e49b70ec6abfec1054a470f353f732739f9214a10a1
剪枝REAP-v2 0.25(推断剪枝率约 25%)
引擎llama.cpp b10537(随包附带)
模态纯文本(无 mmproj,无视觉能力)

性能/Benchmark 摘要

详细报告见仓库配套文档(本 README 引用以下基准结论,均来自本地实测):A线 llama-native、B线 SWE-bench、C线 AgentSkills+GAIA 评测。
评测项结果
C 线 GAIA(2 样本,v1 口径)完整率 50%,Score 0.741
C 线 GAIA(扩充 52 样本)完整率 1.9%,Score 0.499(内容正确率 100%,格式遵循偏弱)
C 线 toolbench-lite100%
C 线 coding-easy75%
C 线 web-search-basic75%
C 线平均 Composite0.794

注意:主体为 Q3KM 低比特量化,复杂推理/数学/代码的精度相比原始权重可能下降;GAIA 格式遵循偏弱为已知短板。

已知限制

  • —qwen35moe 为自定义混合架构,transformers 支持未验证;推荐使用本仓库随附的 llama.cpp。
  • —256K KV cache 未量化,实际可用上下文受硬件内存限制(默认脚本用 16K)。
  • —本仓为纯文本 GGUF,不含官方多模态(Vision)能力。
  • —仅附带 macOS ARM64 / Metal 构建;其他平台请自行准备 llama.cpp。

引用

bibtex
@misc{qwen35moe,
  title = {Qwen3.6-35B-A3B},
  author = {Qwen Team, Alibaba Cloud},
  year = {2026},
  url = {https://huggingface.co/Qwen/Qwen3.6-35B-A3B}
}
gatilin/Qwen3.6-35B-A3b-pruned-v2 · CoolFace