CoolFace
Modelpublic

inoryQwQ/sherpa-onnx-sense-voice-ax650

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes9downloads
Model Card

sherpa-onnx-sense-voice-ax650

SenseVoice multilingual ASR model converted to AX650 AXMODEL for on-device inference via sherpa-onnx. Supports Chinese, English, Japanese, Cantonese, and Korean.

Model Details

  • —Original Model: FunAudioLLM/SenseVoiceSmall
  • —Architecture: SAN-M (Self-Attention Network with Memory) encoder + CTC decoder
  • —Task: Multilingual ASR + emotion recognition
  • —Languages: Chinese (zh), English (en), Japanese (ja), Cantonese (yue), Korean (ko)
  • —Sample rate: 16000 Hz
  • —Target Chip: AX650 (NPU3)
  • —Quantization: U16

Files

FileDescription
sensevoice.axmodelAX650 compiled SenseVoice model
tokens.txtToken vocabulary file
am.mvnAcoustic model mean/variance normalization
chn_jpn_yue_eng_ko_spectok.bpe.modelBPE tokenizer model

Usage with sherpa-onnx

bash
./sherpa-onnx-offline \
  --sense-voice-model=sensevoice.axmodel \
  --tokens=tokens.txt \
  --provider=axera \
  audio.wav

Performance

MetricValue
RTFTBD

Conversion Details

  • —Pulsar2 Version: 6.0
  • —Calibration: MinMax with 10 samples
  • —Quantization: U16

License

Apache 2.0