suko/whisper-taiwanese-demo
0
🎙️ 台語(台灣閩南語)語音辨識 Demo
This Space hosts a Gradio demo of **MediaTek-Research/Breeze-ASR-26**, a Whisper-large-v2 fine-tune for Taiwanese Hokkien (閩南語 / Taigi) ASR trained on ~10,000 hours of large-scale synthetic Taigi speech.
關於模型
由 MediaTek Research(聯發科技)團隊開發,屬於 Breeze Taigi 框架的一部分 (標準化的台語語音技術評測框架)。
Benchmark 比較(Taigi ASR Benchmark, 越低越好)
已知限制
- 訓練資料全合成,可能跟真實自然口語有些落差
- 強腔調、特殊術語可能掉準度
- 各樣本 CER 從 14.49 % 到 52.78 % 都有(差異大)
- 永遠輸出國語漢字,不是台語正字(要台語正字需另做翻譯)
本 Space
- SDK:Gradio 6.15.1
- Hardware:ZeroGPU (RTX PRO 6000 Blackwell, 48 GB half-MIG slice)
- 推論精度:bf16(VRAM ~3 GB)
- Named API endpoint:
/transcribe
怎麼用
1. 瀏覽器 UI
開 https://huggingface.co/spaces/suko/whisper-taiwanese-demo 上傳台語音訊或用麥克風錄音,按「開始辨識」。
2. 程式呼叫(API)
請參考 `ADAPT.md` — 完整說明如何用 gradio_client(Python) 或直接打 Gradio HTTP endpoint(瀏覽器 / Node.js)呼叫 /transcribe。
簡短版(Python smoke test):
from gradio_client import Client, handle_file
c = Client("https://suko-whisper-taiwanese-demo.hf.space")
result = c.predict(
audio_path=handle_file("audio.wav"),
api_name="/transcribe",
)
# result 是國語漢字的字串License
本 demo 使用 Apache 2.0 的模型,商用 OK。
模型權利歸 MediaTek-Research 及 Breeze Taigi 團隊所有。 請引用:arXiv:2603.19259
