batiai/batisay-ko-turbo
296
batisay-ko-turbo — 온디바이스 한국어 STT (통화·회의·대화)
로컬에서 도는 한국어 통화·회의 STT. 오디오는 기기 밖으로 나가지 않고, 분당 과금도 없습니다. 212초 통화를 Mac Studio에서 ~5초에 전사 (41× 실시간, whisper.cpp Metal 실측 · 2026-07-31 팀 스모크). ✅ 추천 기본 모델: 이 모델의 `q5_0` — 통화·회의·대화·강의 전 도메인.
Quickstart (whisper.cpp — 주 경로):
hf download batiai/batisay-ko-turbo ggml-batisay-ko-turbo-q5_0.bin --local-dir .
whisper-cli -m ggml-batisay-ko-turbo-q5_0.bin -l ko -f audio.wav \
--suppress-nst --max-context 0 --output-txtMac 경로는 whisper.cpp 또는 MLX(batisay-ko-turbo-mlx) 권장. Transformers AutoProcessor 는 2026-08-01 호환 핫픽스 반영됨(4.57+).
내 Mac/PC에서 바로 돌리는 한국어 음성-텍스트 변환 모델. 실제 전화 통화·회의·일상 대화에 강하고, 서버 없이 오프라인으로 동작합니다. 51분 통화를 약 1분에 전사(실시간 대비 최대 ~58배).
- 🎙️ 멀티도메인: 통화(8kHz)·회의(다화자)·강의·일상 대화·일반 음성
- 🍎 온디바이스: Apple Silicon(MLX)·whisper.cpp(Mac/Linux/Windows/iOS/Android), 음성 외부 전송 없음
- 🔓 공개 배포: 게이트/로그인 없이 자유 다운로드 (상업 조건은 아래 라이선스)
- 베이스: OpenAI Whisper large-v3-turbo (809M) 한국어 파인튜닝
🍎 Mac 사용자: 더 빠른 MLX 버전 있음 → `batiai/batisay-ko-turbo-mlx` 🔓 완전 무료(Apache 2.0) 가 필요하면 → `batiai/batisay-ko-base` (일반 음성 중심)
<!-- BENCH-START -->
정확도 (CER, 낮을수록 정확)
도메인별 — N=500/도메인, 엄격 정규화
측정: GPU(transformers), 도메인당 500발화. 상담 5.67%는 콜센터 in-domain 벤치로, 아래 실사용 장문 통화와는 별개입니다.
실사용 장문 통화 (2~51분)
실제 사용자 통화 5건(2·4·8·12·51분, 약 27,000자 — 그중 51분 1건이 약 72%)의 소표본 측정. 참조 전사가 사람 정답이 아닌 자동 전사 기준이라 절대치보다 버전/포맷 간 상대비교 지표입니다(정식 정답셋 확대 예정). 51분 초장문: base 31.1% / 이전 버전 30.3% → 현재 19.4%.
<!-- BENCH-END -->
속도 (Mac M4 Max, 동일 7.8분 통화 실측)
rtf = 처리시간 / 오디오길이 (작을수록 빠름). q5_0 이 속도·품질·크기 밸런스로 배포 기본값, MLX fp16 이 최고 속도·정확도.사용 방법
whisper.cpp (Mac / Linux / Windows / iOS / Android)
hf download batiai/batisay-ko-turbo ggml-batisay-ko-turbo-q5_0.bin --local-dir .
# 권장 (전 도메인 기본값)
./whisper-cli -m ggml-batisay-ko-turbo-q5_0.bin -l ko -f audio.wav \
--suppress-nst --max-context 0 --output-txt--suppress-nst --max-context 0은 장문 전사 시 침묵/전환 구간의 반복 환각·디코더 붕괴를 방지합니다 (60분+ 어닝콜에서 재무 수치 recall ~83% 확보). 표준 단문에서 무회귀 검증 → 전 도메인 기본 권장. 실시간 streaming 은whisper.cpp/examples/stream사용.
MLX (Apple Silicon 최적)
import mlx_whisper
r = mlx_whisper.transcribe("audio.wav", path_or_hf_repo="batiai/batisay-ko-turbo-mlx",
language="ko", condition_on_previous_text=False)자세한 옵션·fp16 변형은 MLX 카드 참조.
BatiFlow App
녹음 → 자동 전사 → AI 요약 → 회의록. batisay-ko-turbo 가 표준 STT 엔진으로 임베드(무료).
모델 정보
- 베이스: OpenAI Whisper large-v3-turbo (809M, encoder = Large v3)
- 학습: 3-cycle 점진 학습, 엄선한 약 4,300시간 (가용 25,000시간+ 중 품질 우선 선별). 일반(KsponSpeech)·회의·강의·일상 대화·콜센터 통화(8kHz)·소음 통화 — 한국어 멀티도메인, AI Hub 기반.
- 정제 라벨: 전사 주석 제거 → 깨끗한 출력. 각 사이클 KsponSpeech 재학습으로 기존 도메인 성능 유지.
- 버전: v1.1 (2026-06-20) —
batisay-ko-base위에 통화 데이터 다양화 + 상담 과적합 제거로 실사용 장문 통화 정확도를 회복. 멀티도메인은 v1.0 동급 유지.
base vs turbo — 어느 걸 쓸까
양자화
라이선스 — BatiAI Community v2
공개 다운로드(게이트 없음). 개인·사내 도구·연구·비영리·공공 = 자유 사용. 외부 SaaS·재판매·연매출 10억원 이상 상업 사용 = support@bati.ai 협의. 출시 4년 후 Apache 2.0 자동 전환. 전문: LICENSE-BATIAI-COMMUNITY.md
변경 이력
- v1.1 (2026-06-20) — 실사용 장문 통화 정확도 회복 (실통화 14.85% MLX / 17.1% ggml, base 19.11% 대비 개선; 51분 통화 base 31.1% → 19.4%). 멀티도메인 v1.0 동급 유지.
- v1.0 (2026-06-15) — 첫 출시 (통화·회의·대화 멀티도메인 3-cycle 학습).
문의
- 라이선스 / 임베드 협의: support@bati.ai · HF Discussions · flow.bati.ai
