CoolFace
Modelpublic

ysober/qwen3.8-27b-dspark-zh

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
0likes174downloads
Model Card

中文 | English

中文优化

RadixArk提供了RadixArk/Qwen3.8-27B-DSpark Dspark草稿模型,该模型对中文请求投机效果一般。我们使用18万条中文-英文混合数据,对其进行重训练。

在完全独立的公开中文测试集上,中文接受长度相比基线投机模型提升 +13.5%(2.7985 → 3.1760),且英文没有退化,10个英文测评全部提升,平均 3.4429 → 3.6287(+5.4%)。

训练数据分布(共 185,368 条):

语言中文英文
占比76.5%23.5%
任务类型RAG推理写作摘要编码对话
占比24.4%20.0%17.2%16.3%15.7%6.5%

注:任务类型占比经四舍五入,合计可能不等于 100%。

模型信息

模型规格

  • —目标模型:Qwen/Qwen3.8-27B-FP8
  • —基线投机模型:RadixArk/Qwen3.8-27B-DSpark
  • —草稿模型参数量:1,359,284,737(1.36B)——与基线投机模型完全一致
  • —草稿模型权重精度:BF16
  • —隐藏层维度:5,120
  • —Transformer 层数:5 层全注意力
  • —注意力:GQA,40 个 query head,8 个 key/value head
  • —目标模型辅助特征层:4、16、28、40、52
  • —置信度头:vanilla Markov head,rank 256
  • —DSpark block size:7 个草稿 token(验证宽度 8,含目标模型的 bonus token)
  • —最大位置编码长度:262,144 模型结构、参数量与权重体积与基线投机模型完全一致,因此SGLang 运行时相同、启动参数相同、目标模型无需任何改动。

评测

两个模型使用的评测配置完全一致:FP8 目标模型 + 未量化的 BF16 草稿模型;DSpark block size 7;采样温度 0.6、top-k 20、top-p 0.95;开启 thinking;max_new_tokens=2048;sampling_seed=0;每个测评最多 128 条 prompt(数据集更小时取全量);并发 16;--attention-backend fa3。两个模型在同一台机器、同一 SGLang 构建、同一评测框架下测得,所有运行零请求错误。

独立公开数据集

测试数据已上传至 Hugging Face:ysober/zh_spec_eval。数据来自:C-Eval、AGIEval Gaokao-MathQA、Chinese-SimpleQA 与 alpaca-gpt4-data-zh,共 512 条 prompt。这些数据源均未出现在本模型的训练语料中,因此该结果衡量的是泛化能力,而不是对训练分布的拟合。

测评RadixArk/Qwen3.8-27B-DSpark**本模型**Δ
zh\alpaca\gpt42.48712.9695+19.40%
zh\_ceval2.59892.8844+10.99%
zh\gaokao\math3.78344.1568+9.87%
zh\_simpleqa2.32452.6932+15.86%
总体平均2.79853.1760+13.49%

训练评测数据集(同分布)

来自训练语料自身的分层保留集,仅取中文样本,共 696 条 prompt,覆盖 6 个领域。该集合没有参与训练,但与训练数据同分布,所以结果会偏好。

测评RadixArk/Qwen3.8-27B-DSpark**本模型**Δ
zh\_chat2.46132.8479+15.71%
zh\_coding3.17433.5242+11.02%
zh\_rag3.41785.3841+57.53%
zh\_reasoning2.49002.7532+10.57%
zh\_summarization2.43103.3839+39.20%
zh\_writing2.06862.3447+13.35%
总体平均2.70413.4413+27.26%

英文数据集

在中文数据上重训练可能损害英文接受长度,实测不但没有退化还产生了提升。

两个模型都在相同的英文测评数据集用同一评测框架重新测量(1,036 条 prompt,10 个测评)。基线公布值一列是RadixArk/Qwen3.8-27B-DSpark公布的测试结果,仅作参考,不能直接比较(评测框架、SGLang 版本、随机种子和 prompt 构造方式都不同)。真正有意义的是其右侧两列实测值,它们是在完全相同的条件下产生。最终本模型在10个测评上全部胜出。

测评基线公布值RadixArk(本框架实测)**本模型**Δ数量
HumanEval3.473.86723.9915+3.21%128
GSM8K4.574.57375.0798+11.06%128
MATH-5004.084.06164.3068+6.04%128
MBPP3.673.40373.6587+7.49%128
AIME 20253.283.32793.4102+2.47%30
AIME 20263.073.12643.1289+0.08%30
LBPP3.033.04673.1357+2.92%128
MT-Bench3.103.14893.3944+7.80%80
Arena-Hard v0.12.712.80562.9191+4.05%128
Alpaca2.953.06723.2623+6.36%128
总体平均3.353.44293.6287+5.40%

这张表同时也验证了我们使用的评测框架本身的正确性,其中 GSM8K 4.5737 vs 4.57、MATH-500 4.0616 vs 4.08、LBPP 3.0467 vs 3.03、MT-Bench 3.1489 vs 3.10、AIME 2025 3.3279 vs 3.28 均相差不到百分之几。差异最大的是 HumanEval(3.87 vs 3.47)和 MBPP(3.40 vs 3.67),这两者差异是由选择的prompt不同导致。

使用 SGLang 部署

 SGLang 版本(上述结果基于 0.5.18)。启动参数与基线投机模型完全相同,只需修改 --speculative-draft-model-path:

bash
sglang serve \
  --trust-remote-code \
  --model-path Qwen/Qwen3.8-27B-FP8 \
  --tp-size 1 \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path <path-to-this-repo> \
  --speculative-dspark-block-size 7 \
  --speculative-draft-model-quantization unquant \
  --mamba-scheduler-strategy extra_buffer \
  --attention-backend fa3