inoryQwQ/sherpa-onnx-paraformer-ax650
05
sherpa-onnx-paraformer-ax650
Paraformer-large-Chuan Chinese ASR model converted to AX650 AXMODEL for on-device inference via sherpa-onnx.
Model Details
- Original Model: csukuangfj/WSChuan-ASR
- Architecture: Paraformer (SAN-M encoder + CIF predictor + SAN-M decoder)
- Task: Chinese speech recognition (ASR)
- Sample rate: 16000 Hz
- Input: 5-second fixed length audio chunks
- Vocabulary: 8404 tokens
- LFR: window=7, shift=6
- Target Chip: AX650 (NPU3)
Files
Performance
Usage with sherpa-onnx
./sherpa-onnx-offline \
--tokens=tokens.txt \
--paraformer=encoder-5-seconds.axmodel,predictor-5-seconds.axmodel,decoder-5-seconds.axmodel \
--provider=axera \
audio.wavKnown Limitations
- INT8 quantization may cause accuracy loss; recognition output may be empty or partially missing
- Fixed 5-second input length; longer audio requires external chunking
- For higher accuracy, use U16 encoder + FP32 predictor + FP32 decoder variants
Conversion Details
- Pulsar2 Version: 6.0 (48520c11)
- Calibration: MinMax with 10 samples
- Quantization: INT8
License
Apache 2.0
