ysober/qwen3.8-27b-dspark-zh
中文 | English
中文优化
RadixArk提供了RadixArk/Qwen3.8-27B-DSpark Dspark草稿模型,该模型对中文请求投机效果一般。我们使用18万条中文-英文混合数据,对其进行重训练。
在完全独立的公开中文测试集上,中文接受长度相比基线投机模型提升 +13.5%(2.7985 → 3.1760),且英文没有退化,10个英文测评全部提升,平均 3.4429 → 3.6287(+5.4%)。
训练数据分布(共 185,368 条):
注:任务类型占比经四舍五入,合计可能不等于 100%。
模型信息
模型规格
- 目标模型:Qwen/Qwen3.8-27B-FP8
- 基线投机模型:RadixArk/Qwen3.8-27B-DSpark
- 草稿模型参数量:1,359,284,737(1.36B)——与基线投机模型完全一致
- 草稿模型权重精度:BF16
- 隐藏层维度:5,120
- Transformer 层数:5 层全注意力
- 注意力:GQA,40 个 query head,8 个 key/value head
- 目标模型辅助特征层:4、16、28、40、52
- 置信度头:vanilla Markov head,rank 256
- DSpark block size:7 个草稿 token(验证宽度 8,含目标模型的 bonus token)
- 最大位置编码长度:262,144 模型结构、参数量与权重体积与基线投机模型完全一致,因此SGLang 运行时相同、启动参数相同、目标模型无需任何改动。
评测
两个模型使用的评测配置完全一致:FP8 目标模型 + 未量化的 BF16 草稿模型;DSpark block size 7;采样温度 0.6、top-k 20、top-p 0.95;开启 thinking;max_new_tokens=2048;sampling_seed=0;每个测评最多 128 条 prompt(数据集更小时取全量);并发 16;--attention-backend fa3。两个模型在同一台机器、同一 SGLang 构建、同一评测框架下测得,所有运行零请求错误。
独立公开数据集
测试数据已上传至 Hugging Face:ysober/zh_spec_eval。数据来自:C-Eval、AGIEval Gaokao-MathQA、Chinese-SimpleQA 与 alpaca-gpt4-data-zh,共 512 条 prompt。这些数据源均未出现在本模型的训练语料中,因此该结果衡量的是泛化能力,而不是对训练分布的拟合。
训练评测数据集(同分布)
来自训练语料自身的分层保留集,仅取中文样本,共 696 条 prompt,覆盖 6 个领域。该集合没有参与训练,但与训练数据同分布,所以结果会偏好。
英文数据集
在中文数据上重训练可能损害英文接受长度,实测不但没有退化还产生了提升。
两个模型都在相同的英文测评数据集用同一评测框架重新测量(1,036 条 prompt,10 个测评)。基线公布值一列是RadixArk/Qwen3.8-27B-DSpark公布的测试结果,仅作参考,不能直接比较(评测框架、SGLang 版本、随机种子和 prompt 构造方式都不同)。真正有意义的是其右侧两列实测值,它们是在完全相同的条件下产生。最终本模型在10个测评上全部胜出。
这张表同时也验证了我们使用的评测框架本身的正确性,其中 GSM8K 4.5737 vs 4.57、MATH-500 4.0616 vs 4.08、LBPP 3.0467 vs 3.03、MT-Bench 3.1489 vs 3.10、AIME 2025 3.3279 vs 3.28 均相差不到百分之几。差异最大的是 HumanEval(3.87 vs 3.47)和 MBPP(3.40 vs 3.67),这两者差异是由选择的prompt不同导致。
使用 SGLang 部署
SGLang 版本(上述结果基于 0.5.18)。启动参数与基线投机模型完全相同,只需修改 --speculative-draft-model-path:
sglang serve \
--trust-remote-code \
--model-path Qwen/Qwen3.8-27B-FP8 \
--tp-size 1 \
--speculative-algorithm DSPARK \
--speculative-draft-model-path <path-to-this-repo> \
--speculative-dspark-block-size 7 \
--speculative-draft-model-quantization unquant \
--mamba-scheduler-strategy extra_buffer \
--attention-backend fa3