CoolFace
Modelpublic

tokimoa/Stockmark-DocReasoner-Qwen2.5-VL-32B-MLX-4bit

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes149downloads
Model Card

Stockmark-DocReasoner-Qwen2.5-VL-32B (MLX 4bit, verified)

Stockmarkの Stockmark-DocReasoner-Qwen2.5-VL-32B(日本語ドキュメント理解・推論特化VLM。製造業ドメイン強化・GENIAC支援・CoT推論対応)を、公式BF16重みからMLX 4bit(group size 64、実効4.74bpw)に量子化したものです。日本語ビジネス文書での検証済みで公開しています。

データを外に出せない環境で、請求書・議事録・契約書・チェックシート等の日本語文書を画像のまま読解・推論できます。

必要バージョン: mlx-vlm 0.6.8以降 または 0.6.3

0.6.4〜0.6.7にはQwen2.5-VL系の画像経路のregressionがあり(#1526・当方の再現報告#1737を経て#1741で修正)、「画像入力時のみ即EOS・ガベージ出力」になります。0.6.8で修正されたことを同系モデルの実測で確認済みです:

bash
pip install mlx-vlm  # 0.6.8以降

0.6.3でも従来どおり動作します(0.6.4〜0.6.7のみ回避してください)。

変換品質の検証(tokimoa)

日本語ビジネス文書5種(請求書・議事録・契約条項・チェックシート・技術文書)に対する正解既知のQA 6問で検証:

  • —6/6問正解(合計金額・表内の数量単価・×項目の特定・担当変更・条項の存続期間・数値指標の読み取り)
  • —同一入力の反復で出力完全一致(決定論的)
  • —<think>...</think> で日本語のCoT推論を出力後、<answer>...</answer> で回答する形式

実測速度(M4 Max 36GB)

  • —生成: 16.9 tok/s / プロンプト処理: 109.9 tok/s(画像2,500トークン級)
  • —ピークメモリ: 21.3GB(重み18GB)

使い方

python
# pip install mlx-vlm  (0.6.8以降 / 0.6.3も可)
from mlx_vlm import load, generate

model, processor = load("tokimoa/Stockmark-DocReasoner-Qwen2.5-VL-32B-MLX-4bit")
messages = [{"role":"user","content":[{"type":"image"},{"type":"text","text":"この請求書の合計金額はいくらですか?"}]}]
text = processor.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
out = generate(model, processor, text, image=["invoice.png"], max_tokens=800, temperature=0.0)
print(out.text)

変換情報

  • —変換元: stockmark/Stockmark-DocReasoner-Qwen2.5-VL-32B(公式BF16、commit 445c725)
  • —変換: mlx-vlm 0.6.7 convert -q --q-bits 4(重み形式は0.6.3ランタイムで互換動作を確認済み)
  • —変換者: tokimoa

ライセンス

Apache-2.0(元モデルに準拠)