inoryQwQ/sherpa-onnx-sense-voice-ax650
09
sherpa-onnx-sense-voice-ax650
SenseVoice multilingual ASR model converted to AX650 AXMODEL for on-device inference via sherpa-onnx. Supports Chinese, English, Japanese, Cantonese, and Korean.
Model Details
- Original Model: FunAudioLLM/SenseVoiceSmall
- Architecture: SAN-M (Self-Attention Network with Memory) encoder + CTC decoder
- Task: Multilingual ASR + emotion recognition
- Languages: Chinese (zh), English (en), Japanese (ja), Cantonese (yue), Korean (ko)
- Sample rate: 16000 Hz
- Target Chip: AX650 (NPU3)
- Quantization: U16
Files
Usage with sherpa-onnx
./sherpa-onnx-offline \
--sense-voice-model=sensevoice.axmodel \
--tokens=tokens.txt \
--provider=axera \
audio.wavPerformance
Conversion Details
- Pulsar2 Version: 6.0
- Calibration: MinMax with 10 samples
- Quantization: U16
License
Apache 2.0
