CoolFace
Modelpublic

batiai/batisay-ko-turbo-mlx

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes21downloads
Model Card

batisay-ko-turbo 1.1 — MLX (Apple Silicon Native)

한국어 통화·회의·대화 STT. Apple Silicon 네이티브 MLX 빌드 — Metal GPU 가속, 온디바이스, 무전송. ggml(whisper.cpp, 전 플랫폼) 배포본은 batiai/batisay-ko-turbo. 본 레포 = Mac 네이티브 MLX (q5_0 대비 더 정확·작음·빠름).

포맷 (2종)

경로정밀도크기실통화 CER권장
/ (root)4-bit463 MB15.7%⭐ 기본 — 작고 빠르고 q5_0보다 정확
fp16/fp161.6 GB14.85%최고 정확 / 초장문

참고 — ggml q5_0 (whisper.cpp 배포본) = 실통화 17.1% / 547 MB. → MLX 4-bit가 q5_0보다 정확(15.7<17.1) + 작음(463<547) + 빠름.

정확도 (CER, 낮을수록 정확)

표준 도메인 (GPU N=500/도메인): | 도메인 | CER | |--------|-----| | 일상 대화 | 3.0% | | 상담 통화 (8kHz, in-domain 벤치) | 5.7% | | 일반 음성 (깨끗) | 7.0% | | 일반 음성 (소음) | 8.3% | | 회의 (다화자) | 8.9% |

실사용 장문 통화 (2~51분, 가장 어려운 셋, ClovaNote 기준 측정): MLX 4-bit 15.7% / fp16 14.85%. (순정 Whisper는 긴 한국어 통화에서 환각 붕괴 — 본 모델은 long-form 일반화 안정.)

⚠️ 5.7%(상담)는 8kHz in-domain 벤치 수치이며, 실사용 장문 통화(~15%)와는 별개입니다. 실통화 수치는 ClovaNote 출력 대비 CER(사람 정답 아님)이라 포맷 간 상대비교 용도입니다(N=5).

속도 (M4 Max, Metal)

rtf ≈ 0.02 (실시간 약 50배). 7.8분 통화 ≈ 8~10초, 51분 통화 ≈ 1분. (4-bit가 fp16보다 메모리 적어 근소 빠름.)

사용법 (mlx-whisper)

bash
pip install mlx-whisper
python
import mlx_whisper
# 4-bit (기본, 권장)
r = mlx_whisper.transcribe(
    "audio.wav", path_or_hf_repo="batiai/batisay-ko-turbo-mlx", language="ko",
    condition_on_previous_text=False,
    temperature=(0.0, 0.2, 0.4, 0.6, 0.8, 1.0),
    compression_ratio_threshold=2.4, logprob_threshold=-1.0,
)
print(r["text"])

fp16 (최고 정확 / 초장문):

bash
hf download batiai/batisay-ko-turbo-mlx --include "fp16/*" --local-dir ./bs-mlx
# → path_or_hf_repo="./bs-mlx/fp16"
권장 디코딩 옵션(환각 억제)은 위 예시 그대로. whisper.cpp/전 플랫폼은 batiai/batisay-ko-turbo 의 ggml q5_0 사용.

라이선스

BatiAI Community License v2. 매출 5억원 미만 / 24개월 미만 스타트업 / 비상업 = 자유 사용. 상업·외부 SaaS = support@bati.ai.

— BatiAI · https://flow.bati.ai