tokimoa/kana-whisper-mlx-fp16
016
kana-whisper (MLX fp16, verified)
SB Intuitionsの kana-whisper(Whisper large-v3-turboのファインチューン。日本語音声をカタカナ列に直接書き起こすASR)を、公式fp32重みからMLX fp16に変換したものです。変換品質の検証済みで公開しています。
Sarashina2.2-TTSプロジェクトのKana CER(カナ文字誤り率)測定の基盤モデルです。Apple Silicon上でTTS評価ループをローカル完結させる用途に使えます。
変換品質の検証(tokimoa)
- transformers版(fp32・greedy)との出力比較: 11/11クリップで完全一致(合成音声8本+JSUT実音声3本、計348文字)
- 同一入力4回反復: 全クリップで出力完全一致(決定論的)
- 実効速度: 11クリップ合計 約5.4秒(M4 Max、モデルロード込み。transformers CPU実行比 約3.5倍)
使い方
# pip install mlx-whisper
import mlx_whisper
result = mlx_whisper.transcribe(
"audio.wav",
path_or_hf_repo="tokimoa/kana-whisper-mlx-fp16",
language="ja", task="transcribe", temperature=0.0,
)
print(result["text"])
# 例: "キョーワイーテンキデスネ"変換情報
- 変換元:
sbintuitions/kana-whisper(fp32 safetensors、HF transformers形式) - 変換: mlx-examples whisper
convert.py(HF形式→MLXキーマッピングhf_to_pt使用)/ mlx-whisper 0.4.3 で動作確認 - 重みファイル名は
weights.safetensors(pip版 mlx-whisper 0.4.3 のローダーがこの名前のみ読み込むため) - alignment_heads は未設定のため、単語レベルのタイムスタンプ精度は保証外です(書き起こし用途には影響なし)
ライセンス
MIT(元モデルのライセンスに準拠)。変換者: tokimoa
