Kandandan/Qwen3.8-Flash-Next-MLX-4bit-MTP
Qwen3.8-Flash-Next MLX 4bit (v-l) + MTP サイドカー
Apple Silicon 向けの 4bit 変換に、MTP (Multi-Token Prediction) の重みを同梱したもの。 mlxturbo の flash_spec 経路で投機デコードが効きます。
素の mlx-lm でもテキスト生成として読めますが、その場合 MTP は使われません。
中身
n-gram (PLE) テーブルは本体に含めず、別サイドカーとして扱います。
使い方
pip install mlxturbo
mlxturbo-serve --model /path/to/this/repo --require-runner flash_spec --port 8765mtp.safetensors が同じディレクトリにあるので、追加のフラグなしで MTP が自動発見されます。 --require-runner flash_spec を付けると、何らかの理由で投機が効かない構成のときに 黙って遅く動かず、起動を拒否します。
速度
M3 Max 128GB、貪欲、160 トークン × 10 課題での実測。
非投機は 31.14 ms/token。効くかどうかは言語ではなく課題の種類で決まり、コードが最も低い (信頼区間が重ならない)。どの課題でも投機は効きます。
短い試行 (48 トークン) では言語差があるように見えますが、標準誤差が ±0.09 あり有意ではありません。
メモリ
77GB を常駐させるので、128GB 以上のマシンを想定しています。96GB 機では厳しく、 64GB 機では載りません。
ライセンス
元モデル Qwen/Qwen3.8-Flash-Next の Qwen Community License 1.0 を継承します。全文は同梱の LICENSE を参照してください。
月間アクティブユーザー 1 億超または月商 2,000 万ドル超の商用製品で使う場合はモデル名の 表示義務が、Model as a Service / AI Work Assistant 事業では別途 Qwen との契約が必要です。
