ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16
0767
Qwen3.8-Flash-Next-MTP-bf16
Qwen/Qwen3.8-Flash-Next の公式 bf16 チェックポイントに内蔵された MTP ヘッド(mtp.* 31 テンソル)を切り出した、 投機デコード用ドラフター。単体では使わない。
- 変換元:
Qwen/Qwen3.8-Flash-Next(revision de4b8e4) - 変換ツール: mlx-vlm main(0.7.0rc0)の
Qwen4ExpMTPSplitter - サイズ: 4.9 GiB(bf16)
必要環境
qwen4_exp_mtp の抽出・実行は mlx-vlm 0.7.0 以降(リリース版 0.6.17 には未収録)。
pip install "mlx-vlm @ git+https://github.com/Blaizzy/mlx-vlm@main"使い方
python -m mlx_vlm generate --model ToPo-ToPo/Qwen3.8-Flash-Next-mlx-4bit \
--draft-model ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16 \
--draft-kind mtp --draft-block-size 2 \
--prompt "..." --max-tokens 512量子化版リポジトリ(4bit / 8bit)の mtp/ サブフォルダにも同じものが入っているので、本体を落とせばドラフターも付いてくる。
抽出コマンド
from mlx_vlm.speculative.drafters.qwen4_exp_mtp.split import Qwen4ExpMTPSplitter
Qwen4ExpMTPSplitter().split("Qwen/Qwen3.8-Flash-Next", "Qwen3.8-Flash-Next-MTP-bf16")量子化後のリポジトリからは mtp.* が落ちている(mlx-vlm の sanitize が除外する)ので、 必ず公式 bf16 から切り出すこと。
