CoolFace
Apppublic

suko/whisper-taiwanese-demo

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
0likes
App README

🎙️ 台語(台灣閩南語)語音辨識 Demo

This Space hosts a Gradio demo of **MediaTek-Research/Breeze-ASR-26**, a Whisper-large-v2 fine-tune for Taiwanese Hokkien (閩南語 / Taigi) ASR trained on ~10,000 hours of large-scale synthetic Taigi speech.

關於模型

由 MediaTek Research(聯發科技)團隊開發,屬於 Breeze Taigi 框架的一部分 (標準化的台語語音技術評測框架)。

項目規格
Base modelopenai/whisper-large-v2
參數量~1.54 B
檔案大小~6 GB (F32) / ~3 GB (bf16)
訓練資料~10,000 小時合成的台語語音(Taigi-synthetic-speech)
Benchmark CER30.13 %(Taigi ASR Benchmark)
輸入格式16 kHz mono
輸出國語漢字(不是台語正字)
LicenseApache 2.0(商用 OK)
PaperarXiv:2603.19259

Benchmark 比較(Taigi ASR Benchmark, 越低越好)

ModelCER
BreezeASR-Taigi (Ours)30.13 % ✅
教育部台灣台語輸入法30.70 %
Breeze ASR 25 (前代, Whisper-large-v2 普通話)49.99 %

已知限制

  • —訓練資料全合成,可能跟真實自然口語有些落差
  • —強腔調、特殊術語可能掉準度
  • —各樣本 CER 從 14.49 % 到 52.78 % 都有(差異大)
  • —永遠輸出國語漢字,不是台語正字(要台語正字需另做翻譯)

本 Space

  • —SDK:Gradio 6.15.1
  • —Hardware:ZeroGPU (RTX PRO 6000 Blackwell, 48 GB half-MIG slice)
  • —推論精度:bf16(VRAM ~3 GB)
  • —Named API endpoint:/transcribe

怎麼用

1. 瀏覽器 UI

開 https://huggingface.co/spaces/suko/whisper-taiwanese-demo 上傳台語音訊或用麥克風錄音,按「開始辨識」。

2. 程式呼叫(API)

請參考 `ADAPT.md` — 完整說明如何用 gradio_client(Python) 或直接打 Gradio HTTP endpoint(瀏覽器 / Node.js)呼叫 /transcribe。

簡短版(Python smoke test):

python
from gradio_client import Client, handle_file
c = Client("https://suko-whisper-taiwanese-demo.hf.space")
result = c.predict(
    audio_path=handle_file("audio.wav"),
    api_name="/transcribe",
)
# result 是國語漢字的字串

License

本 demo 使用 Apache 2.0 的模型,商用 OK。

模型權利歸 MediaTek-Research 及 Breeze Taigi 團隊所有。 請引用:arXiv:2603.19259