batiai/batisay-ko-turbo-mlx
021
batisay-ko-turbo 1.1 — MLX (Apple Silicon Native)
한국어 통화·회의·대화 STT. Apple Silicon 네이티브 MLX 빌드 — Metal GPU 가속, 온디바이스, 무전송. ggml(whisper.cpp, 전 플랫폼) 배포본은 batiai/batisay-ko-turbo. 본 레포 = Mac 네이티브 MLX (q5_0 대비 더 정확·작음·빠름).
포맷 (2종)
참고 — ggml q5_0 (whisper.cpp 배포본) = 실통화 17.1% / 547 MB. → MLX 4-bit가 q5_0보다 정확(15.7<17.1) + 작음(463<547) + 빠름.
정확도 (CER, 낮을수록 정확)
표준 도메인 (GPU N=500/도메인): | 도메인 | CER | |--------|-----| | 일상 대화 | 3.0% | | 상담 통화 (8kHz, in-domain 벤치) | 5.7% | | 일반 음성 (깨끗) | 7.0% | | 일반 음성 (소음) | 8.3% | | 회의 (다화자) | 8.9% |
실사용 장문 통화 (2~51분, 가장 어려운 셋, ClovaNote 기준 측정): MLX 4-bit 15.7% / fp16 14.85%. (순정 Whisper는 긴 한국어 통화에서 환각 붕괴 — 본 모델은 long-form 일반화 안정.)
⚠️ 5.7%(상담)는 8kHz in-domain 벤치 수치이며, 실사용 장문 통화(~15%)와는 별개입니다. 실통화 수치는 ClovaNote 출력 대비 CER(사람 정답 아님)이라 포맷 간 상대비교 용도입니다(N=5).
속도 (M4 Max, Metal)
rtf ≈ 0.02 (실시간 약 50배). 7.8분 통화 ≈ 8~10초, 51분 통화 ≈ 1분. (4-bit가 fp16보다 메모리 적어 근소 빠름.)
사용법 (mlx-whisper)
pip install mlx-whisperimport mlx_whisper
# 4-bit (기본, 권장)
r = mlx_whisper.transcribe(
"audio.wav", path_or_hf_repo="batiai/batisay-ko-turbo-mlx", language="ko",
condition_on_previous_text=False,
temperature=(0.0, 0.2, 0.4, 0.6, 0.8, 1.0),
compression_ratio_threshold=2.4, logprob_threshold=-1.0,
)
print(r["text"])fp16 (최고 정확 / 초장문):
hf download batiai/batisay-ko-turbo-mlx --include "fp16/*" --local-dir ./bs-mlx
# → path_or_hf_repo="./bs-mlx/fp16"권장 디코딩 옵션(환각 억제)은 위 예시 그대로. whisper.cpp/전 플랫폼은 batiai/batisay-ko-turbo 의 ggml q5_0 사용.
라이선스
BatiAI Community License v2. 매출 5억원 미만 / 24개월 미만 스타트업 / 비상업 = 자유 사용. 상업·외부 SaaS = support@bati.ai.
— BatiAI · https://flow.bati.ai
