CoolFace
Modelpublic

tokimoa/kana-whisper-mlx-fp16

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes16downloads
Model Card

kana-whisper (MLX fp16, verified)

SB Intuitionsの kana-whisper(Whisper large-v3-turboのファインチューン。日本語音声をカタカナ列に直接書き起こすASR)を、公式fp32重みからMLX fp16に変換したものです。変換品質の検証済みで公開しています。

Sarashina2.2-TTSプロジェクトのKana CER(カナ文字誤り率)測定の基盤モデルです。Apple Silicon上でTTS評価ループをローカル完結させる用途に使えます。

変換品質の検証(tokimoa)

  • —transformers版(fp32・greedy)との出力比較: 11/11クリップで完全一致(合成音声8本+JSUT実音声3本、計348文字)
  • —同一入力4回反復: 全クリップで出力完全一致(決定論的)
  • —実効速度: 11クリップ合計 約5.4秒(M4 Max、モデルロード込み。transformers CPU実行比 約3.5倍)

使い方

python
# pip install mlx-whisper
import mlx_whisper

result = mlx_whisper.transcribe(
    "audio.wav",
    path_or_hf_repo="tokimoa/kana-whisper-mlx-fp16",
    language="ja", task="transcribe", temperature=0.0,
)
print(result["text"])
# 例: "キョーワイーテンキデスネ"

変換情報

  • —変換元: sbintuitions/kana-whisper(fp32 safetensors、HF transformers形式)
  • —変換: mlx-examples whisper convert.py(HF形式→MLXキーマッピング hf_to_pt 使用)/ mlx-whisper 0.4.3 で動作確認
  • —重みファイル名は weights.safetensors(pip版 mlx-whisper 0.4.3 のローダーがこの名前のみ読み込むため)
  • —alignment_heads は未設定のため、単語レベルのタイムスタンプ精度は保証外です(書き起こし用途には影響なし)

ライセンス

MIT(元モデルのライセンスに準拠)。変換者: tokimoa