CoolFace
Modelpublic

inoryQwQ/sherpa-onnx-paraformer-ax650

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes5downloads
Model Card

sherpa-onnx-paraformer-ax650

Paraformer-large-Chuan Chinese ASR model converted to AX650 AXMODEL for on-device inference via sherpa-onnx.

Model Details

  • —Original Model: csukuangfj/WSChuan-ASR
  • —Architecture: Paraformer (SAN-M encoder + CIF predictor + SAN-M decoder)
  • —Task: Chinese speech recognition (ASR)
  • —Sample rate: 16000 Hz
  • —Input: 5-second fixed length audio chunks
  • —Vocabulary: 8404 tokens
  • —LFR: window=7, shift=6
  • —Target Chip: AX650 (NPU3)

Files

FilePrecisionSizeDescription
encoder-5-seconds.axmodelINT8165 MBEncoder [1,83,560]→[1,83,512]
predictor-5-seconds.axmodelINT8831 KBPredictor [1,83,512]→[1,83]
decoder-5-seconds.axmodelINT860 MBDecoder [1,83,512]×3→[1,83,8404]

Performance

MetricValue
RTF0.007
Pulsar2 Version6.0 (commit 48520c11)

Usage with sherpa-onnx

bash
./sherpa-onnx-offline \
  --tokens=tokens.txt \
  --paraformer=encoder-5-seconds.axmodel,predictor-5-seconds.axmodel,decoder-5-seconds.axmodel \
  --provider=axera \
  audio.wav

Known Limitations

  • —INT8 quantization may cause accuracy loss; recognition output may be empty or partially missing
  • —Fixed 5-second input length; longer audio requires external chunking
  • —For higher accuracy, use U16 encoder + FP32 predictor + FP32 decoder variants

Conversion Details

  • —Pulsar2 Version: 6.0 (48520c11)
  • —Calibration: MinMax with 10 samples
  • —Quantization: INT8

License

Apache 2.0