CoolFace
Modelpublic

tokimoa/jp-jitsumu-whisper-lora

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes
Model Card

jp-jitsumu-whisper-lora

後継版があります: Zoom等の圧縮された実会議音声への頑健性のためベースをwhisper-large-v3-turboに交代し、専門用語recallを54.1%→75.1%に高めた jp-jitsumu-whisper-turbo-lora を公開しました。新規利用はturbo版を推奨します。

日本語音声認識モデル kotoba-whisper-v2.0(Whisper large-v3の日本語蒸留・6.3倍速)を、業務専門用語に強化したLoRAアダプタです。Apple Silicon(MLX)で動作します。

汎用ASRは会計・法務・ITの専門用語で同音異義の漢字選択を誤ります(減価償却費→「原価焼却費」、委任状→「因縁上」、帯域幅→「体域幅」)。この表記選択を、正解既知の合成音声で学習しています。

使い方

bash
pip install 'mlx-tune[audio]'
hf download tokimoa/jp-jitsumu-whisper-lora --local-dir jitsumu-asr
python
from mlx_tune import FastSTTModel

model, _ = FastSTTModel.from_pretrained("kotoba-tech/kotoba-whisper-v2.0")
model.load_adapter("jitsumu-asr/adapter")
print(model.transcribe("meeting.wav", language="ja"))

認識例(実出力・未見用語)

音声内容ベース本アダプタ
委任状でトラブルが発生したため、原因を調査中です。因縁上でトラブルが…委任状でトラブルが…
帯域幅の逼迫の取り扱いを確認してください。体域幅のひっ迫の…帯域幅の逼迫の…
繰越欠損金を前提に、スケジュールを引き直します。くりこし欠損金を…繰越欠損金を…

評価

専門用語(会計・法務・IT)を含む合成音声250文で評価。用語プールは学習と検証でステムレベル分離しており、検証の用語はすべて学習に含まれない未見語です。

モデル専門用語 表記recallCER
kotoba-whisper-v2.0(ベース)28.3%14.3%
whisper-large-v3(蒸留元)37.3%9.2%
本アダプタ54.1%5.4%

一般的な業務文(336語)は98.2%で、専門用語の強化による回帰はありません。

想定ユースケース

業務の録音をローカルで文字にする場面を想定しています。

  • —会議・打ち合わせ録音の文字起こし。議事録の下書き作成では、抽出モデル jp-minutes-extractor-1.7b と組み合わせると、音声から出席者・決定事項・宿題のJSONまでをローカルで一気通貫できます
  • —経理・法務・IT運用の定例や、監査対応のヒアリング記録など、専門用語の表記精度が成果物の品質に直結する転写
  • —社外に出せない録音の処理。ベース6.3倍速の蒸留モデルなので、16GBのMacでも実時間より十分速く回ります

他形式

whisper.cpp形式(Windows/Linux/mac・大規模GPU不要)は jp-jitsumu-whisper-ggml で配布しています。whisper.cppの既定デコードでは専門用語recall 57.1%(q5_0/f16とも・同一評価セット実測)です。

学習

  • —LoRA(rank 8・デコーダのみ)。専門用語の漢字選択はデコーダ側の言語事前分布の問題であるため、エンコーダは凍結
  • —データ: 業務専門用語文(会計・法務・IT 98語)の合成音声(Kokoro-82M TTS・話者5種・話速ゆらぎ)5,894文+一般業務文2,499文+Common Voice 26.0日本語(CC0)実音声8,000クリップ
  • —TTSの読み誤りによる誤対データは、読み一致フィルタ(形態素解析の読みでCERを取り、表記の同音異義違いは許容)で除去
  • —すべてのデータソースは商用利用・ML学習利用が明示的に許可されたもの(Apache-2.0 / CC0)

ライセンス

Apache-2.0(ベースモデルkotoba-whisper-v2.0のライセンスを継承)


Developed by tokimoa