CoolFace
Modelpublic

ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16

sourceHugging Faceotherupdated 28d agoView on Hugging Face
0likes767downloads
Model Card

Qwen3.8-Flash-Next-MTP-bf16

Qwen/Qwen3.8-Flash-Next の公式 bf16 チェックポイントに内蔵された MTP ヘッド(mtp.* 31 テンソル)を切り出した、 投機デコード用ドラフター。単体では使わない。

  • —変換元: Qwen/Qwen3.8-Flash-Next(revision de4b8e4)
  • —変換ツール: mlx-vlm main(0.7.0rc0)の Qwen4ExpMTPSplitter
  • —サイズ: 4.9 GiB(bf16)

必要環境

qwen4_exp_mtp の抽出・実行は mlx-vlm 0.7.0 以降(リリース版 0.6.17 には未収録)。

pip install "mlx-vlm @ git+https://github.com/Blaizzy/mlx-vlm@main"

使い方

python -m mlx_vlm generate --model ToPo-ToPo/Qwen3.8-Flash-Next-mlx-4bit \
    --draft-model ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16 \
    --draft-kind mtp --draft-block-size 2 \
    --prompt "..." --max-tokens 512

量子化版リポジトリ(4bit / 8bit)の mtp/ サブフォルダにも同じものが入っているので、本体を落とせばドラフターも付いてくる。

抽出コマンド

python
from mlx_vlm.speculative.drafters.qwen4_exp_mtp.split import Qwen4ExpMTPSplitter
Qwen4ExpMTPSplitter().split("Qwen/Qwen3.8-Flash-Next", "Qwen3.8-Flash-Next-MTP-bf16")

量子化後のリポジトリからは mtp.* が落ちている(mlx-vlm の sanitize が除外する)ので、 必ず公式 bf16 から切り出すこと。