CoolFace
Modelpublic

tokimoa/jp-minutes-extractor-1.7b

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes
Model Card

jp-minutes-extractor-1.7b

日本語の議事録・会議メモから、出席者・決定事項・宿題(担当/期限)・次回予定を構造化JSONで抽出するLoRAアダプタです。ベースモデルは Qwen/Qwen3-1.7B。Apple Silicon(mlx-lm)で動作し、16GBメモリのMacで実行できます。

整った議事録だけでなく、チャットログ・走り書きメモ・敬語文・英語混じりといった崩れた入力を対象に設計しています。表記ゆれの正規化(8/7 10am → 8月7日 10:00、$12k → 12,000ドル)、肩書き・欠席者・誤字の処理、役職参照(「社長」)から人名への解決を行います。

使い方

bash
pip install mlx-lm
hf download tokimoa/jp-minutes-extractor-1.7b --local-dir jp-minutes-extractor
python -m mlx_lm generate --model Qwen/Qwen3-1.7B --adapter-path jp-minutes-extractor/adapter \
  --prompt "次の議事録から出席者・決定事項・宿題(担当と期限)・次回予定を抽出してJSONで出力してください。\n\n<議事録本文>" \
  --max-tokens 800 --temp 0.0

入力例

text
7/31(木) 販売管理の件メモ
出席: 高木(部長)、瀬川、大村
・内藤は欠席
・請求書の発行を月2回→月1回に集約でOKもらった
・新しい販売管理ツールは11月から試験導入ことに
・TODO 移行スケジュル案 瀬川 8/20
・大村: 現行ツールの解約条件を確認(今週中)
next 8/7(木) 10am

出力例(実出力・temperature 0)

json
{
  "date": "7月31日",
  "attendees": ["高木", "瀬川", "大村"],
  "decisions": [
    "請求書の発行を月2回から月1回に集約する",
    "新しい販売管理ツールは11月から試験導入する"
  ],
  "todos": [
    {"task": "移行スケジュール案を提出する", "owner": "瀬川", "due": "8月20日"},
    {"task": "現行ツールの解約条件を確認する", "owner": "大村", "due": "今週中"}
  ],
  "next_meeting": "8月7日 10:00"
}

肩書きの除去(高木(部長)→高木)、欠席者の除外、崩れた表現の正規化(月2回→月1回に集約でOKもらった→「集約する」、8/7(木) 10am→「8月7日 10:00」)、誤字の復元(スケジュル→スケジュール)を行っていることが分かります。

評価

学習データと名前・話題・語彙プールをステムレベルで分離した検証セットで採点しています。

合成val(8形式・役職/欠席/誤字ノイズ入り・50件)

フィールド厳格一致
attendees45/50
decisions44/50
todos50/50
next_meeting50/50
全フィールド同時合格39/50

手書きカナリア(チャットログ・敬語・走り書き・英語混じり・長文脱線の5本、学習データと無関係に作成)

指標結果
attendees 厳格一致5/5
next_meeting 厳格一致4/5
decisions 事実網羅(数値・日付・人名が出力に含まれる)12事実中11

決定事項の出力語形は原文の引用ではなく正規形への要約です。ベースモデル素の状態では同条件でJSONスキーマが安定しないため、抽出タスクにはこのアダプタの適用を前提としてください。

訓練

  • —mlx-lm LoRA(rank 8・lr 1e-5・batch 4・iter 1200・--mask-prompt)
  • —データ: 構造先行生成による合成議事録18,000行。構造(出席者・決定・宿題・次回)を先に生成してから8形式(箇条書き・時系列・散文・チャットログ・走り書き・敬語・英語混じり・長文脱線)でレンダリングするため、正解ラベルが構成上完全に既知
  • —本文には崩れた表記(7/25(金)・$12k・各自・EOW・カタカナ誤字・肩書き・遅刻/欠席マーカー)を混入させ、正解側は常に正規形に揃えることで正規化を学習

ライセンス

Apache-2.0(ベースモデルQwen3-1.7Bのライセンスを継承)


Developed by tokimoa