ShiWarai/sherpa-rknn-whisper-turbo
0
sherpa-rknn-whisper-turbo
Whisper large-v3-turbo для Rockchip RK3588: encoder в RKNN (NPU) + decoder в ONNX (CPU).
Используется с whisper-rknn в гибридном режиме (~2× быстрее полного RKNN на autoregressive decode).
Файлы
decoder.onnx — квантованная версия (ONNX Runtime quantize_dynamic, только MatMul, QInt8) из FP32 export sherpa-onnx.
На RK3588 даёт ~10–17% ускорения decoder и ~10% wall на длинных файлах при сопоставимом качестве.
Использование с whisper-rknn
Каталог моделей на хосте (единственный источник для локального деплоя):
WHISPER_MODELS_DIR=/mnt/nvme0/models/sherpa-rknn-whisper-turboВ контейнере:
export WHISPER_ENCODER=/models/encoder.rknn
export WHISPER_DECODER=/models/decoder.onnx
export WHISPER_DECODER_BACKEND=onnx
export WHISPER_TOKENS=/models/tokens.txt
export WHISPER_MODEL_PROFILE=turbo
export WHISPER_LANGUAGE=ruСкачать: git clone / huggingface-cli download ShiWarai/sherpa-rknn-whisper-turbo.
Происхождение
Encoder: FP RKNN (do_quantization=False), не w8a8.
