CoolFace
Modelpublic

ShiWarai/sherpa-rknn-whisper-turbo

sourceHugging Facemitupdated 2mo agoView on Hugging Face
0likes
Model Card

sherpa-rknn-whisper-turbo

Whisper large-v3-turbo для Rockchip RK3588: encoder в RKNN (NPU) + decoder в ONNX (CPU).

Используется с whisper-rknn в гибридном режиме (~2× быстрее полного RKNN на autoregressive decode).

Файлы

ФайлНазначениеРазмер
encoder.rknnEncoder (NPU), FP16 RKNN~1.3 GiB
decoder.onnxDecoder (CPU), dynamic INT8 MatMul~344 MiB
tokens.txtСловарь токенов~800 KiB

decoder.onnx — квантованная версия (ONNX Runtime quantize_dynamic, только MatMul, QInt8) из FP32 export sherpa-onnx.

На RK3588 даёт ~10–17% ускорения decoder и ~10% wall на длинных файлах при сопоставимом качестве.

Использование с whisper-rknn

Каталог моделей на хосте (единственный источник для локального деплоя):

bash
WHISPER_MODELS_DIR=/mnt/nvme0/models/sherpa-rknn-whisper-turbo

В контейнере:

bash
export WHISPER_ENCODER=/models/encoder.rknn
export WHISPER_DECODER=/models/decoder.onnx
export WHISPER_DECODER_BACKEND=onnx
export WHISPER_TOKENS=/models/tokens.txt
export WHISPER_MODEL_PROFILE=turbo
export WHISPER_LANGUAGE=ru

Скачать: git clone / huggingface-cli download ShiWarai/sherpa-rknn-whisper-turbo.

Происхождение

КомпонентИсточник
ONNX encoder/decoder (FP32)csukuangfj/sherpa-onnx-whisper-turbo
Encoder ONNX → RKNNsherpa-onnx scripts/whisper/rknn/export_onnx.py + export_rknn.py, RK3588
Decoder INT8dynamic quant MatMul из sherpa-onnx-whisper-turbo FP32 decoder (rknn-build/scripts/quantize_decoder_int8.py)

Encoder: FP RKNN (do_quantization=False), не w8a8.