tokimoa/jp-jitsumu-whisper-lora
0
jp-jitsumu-whisper-lora
後継版があります: Zoom等の圧縮された実会議音声への頑健性のためベースをwhisper-large-v3-turboに交代し、専門用語recallを54.1%→75.1%に高めた jp-jitsumu-whisper-turbo-lora を公開しました。新規利用はturbo版を推奨します。
日本語音声認識モデル kotoba-whisper-v2.0(Whisper large-v3の日本語蒸留・6.3倍速)を、業務専門用語に強化したLoRAアダプタです。Apple Silicon(MLX)で動作します。
汎用ASRは会計・法務・ITの専門用語で同音異義の漢字選択を誤ります(減価償却費→「原価焼却費」、委任状→「因縁上」、帯域幅→「体域幅」)。この表記選択を、正解既知の合成音声で学習しています。
使い方
pip install 'mlx-tune[audio]'
hf download tokimoa/jp-jitsumu-whisper-lora --local-dir jitsumu-asrfrom mlx_tune import FastSTTModel
model, _ = FastSTTModel.from_pretrained("kotoba-tech/kotoba-whisper-v2.0")
model.load_adapter("jitsumu-asr/adapter")
print(model.transcribe("meeting.wav", language="ja"))認識例(実出力・未見用語)
評価
専門用語(会計・法務・IT)を含む合成音声250文で評価。用語プールは学習と検証でステムレベル分離しており、検証の用語はすべて学習に含まれない未見語です。
一般的な業務文(336語)は98.2%で、専門用語の強化による回帰はありません。
想定ユースケース
業務の録音をローカルで文字にする場面を想定しています。
- 会議・打ち合わせ録音の文字起こし。議事録の下書き作成では、抽出モデル jp-minutes-extractor-1.7b と組み合わせると、音声から出席者・決定事項・宿題のJSONまでをローカルで一気通貫できます
- 経理・法務・IT運用の定例や、監査対応のヒアリング記録など、専門用語の表記精度が成果物の品質に直結する転写
- 社外に出せない録音の処理。ベース6.3倍速の蒸留モデルなので、16GBのMacでも実時間より十分速く回ります
他形式
whisper.cpp形式(Windows/Linux/mac・大規模GPU不要)は jp-jitsumu-whisper-ggml で配布しています。whisper.cppの既定デコードでは専門用語recall 57.1%(q5_0/f16とも・同一評価セット実測)です。
学習
- LoRA(rank 8・デコーダのみ)。専門用語の漢字選択はデコーダ側の言語事前分布の問題であるため、エンコーダは凍結
- データ: 業務専門用語文(会計・法務・IT 98語)の合成音声(Kokoro-82M TTS・話者5種・話速ゆらぎ)5,894文+一般業務文2,499文+Common Voice 26.0日本語(CC0)実音声8,000クリップ
- TTSの読み誤りによる誤対データは、読み一致フィルタ(形態素解析の読みでCERを取り、表記の同音異義違いは許容)で除去
- すべてのデータソースは商用利用・ML学習利用が明示的に許可されたもの(Apache-2.0 / CC0)
ライセンス
Apache-2.0(ベースモデルkotoba-whisper-v2.0のライセンスを継承)
Developed by tokimoa
