CoolFace
Modelpublic

csukuangfj/WSChuan-ASR

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes
Model Card

📂 Project Tree

WSChuan-ASR
├── paraformer_large_chuan/
│ ├── config.yaml
│ ├── model.pt
│ └── infer.py
│
├── Qwen2.5-omni3B/
| ├──added_tokens.json
| ├──args.json
| ├──char_template.jinja
| ├──config.json
| ├──generation_config.json
| ├──merges.txt
| ├──model-00001-of-00003.safetensors
| ├──model-00002-of-00003.safetensors
| ├──model-00003-of-00003.safetensors
| ├──model.safetensors.index.json
| ├──preprocessor_config.json
| ├──special_tokens_map.json
| ├──spk_dict.pt
| ├──tokenizer_config.json
| ├──tokenizer.json
| ├──video_preprocessor_config.json
| └──vocab.json
│
├── .gitattributes
└── README.md

ASR Leaderboard

ModelModel SizeWSC-Eval-ASR - EasyWSC-Eval-ASR - HardWSC-Eval-ASR - TotalMagicdata - ConversationMagicdata - Daily-UseAvg.
with LLM
Kimi-Audio<sup></sup>7B16.6528.6617.6624.675.7718.68
FireRedASR-LLM<sup></sup>8.3B12.8025.2714.4017.686.6915.37
Qwen2.5-omni<sup></sup>3B16.9426.0118.2020.406.3217.69
Qwen2.5-omni-WSC-Finetune⭐3B14.3624.1415.6118.456.1515.74
<span style="background-color: #d4edda; padding: 0 2px;">Qwen2.5-omni+internal data⭐</span>3B13.1723.3614.8118.505.8815.14
<span style="background-color: #d4edda; padding: 0 2px;">Qwen2.5-omni-WSC-Finetune + internal data⭐</span>3B12.9323.1914.2517.95<u>5.89</u>14.84
without LLM
SenseVoice-small<sup></sup>234M17.4328.3818.3923.508.7719.29
Whisper<sup></sup>244M52.0663.9953.5955.8852.0355.51
FireRedASR-AED<sup></sup>1.1B13.2923.6414.6217.846.6915.14
Paraformer<sup></sup>220M14.3424.6115.6619.818.1616.52
Paraformer-WSC-Finetune⭐220M12.1522.6013.5116.608.0214.58
<span style="background-color: #d4edda; padding: 0 2px;">Paraformer + internal data⭐</span>220M<u>11.93</u><u>21.82</u><u>13.14</u><u>15.61</u>6.77<u>13.85</u>
<span style="background-color: #d4edda; padding: 0 2px;">Paraformer-WSC-Finetune + internal data</span>⭐220M11.5921.5912.8714.596.2813.38

ASR Inference

ParaformerlargeChuan

export CUDA_VISIBLE_DEVICES=7
root_dir=./test_data
test_sets=("WSC-Eval-ASR" "WSC-Eval-ASR-Hard" "WSC-Eval-ASR-Easy")
model_dir=./model_dir

out_rootdir=./results
mkdir -p $out_rootdir
python infer_paraformer.py \
  --model $model_dir \
  --wav_scp_file $root_dir/$test_data/wav.scp \
  --output_dir $out_rootdir/debug \
  --device "cuda" \
  --output_file $out_dir/hyp.txt

Qwen2.5-Omni-3B_Chuan

python infer_qwen2.5omni.py \
    --wavs_path /path/to/your/wav.scp \
    --out_path /path/to/your/results.txt \
    --gpu 0 \
    --model /path/to/your/model

Note:

Original: https://huggingface.co/ASLP-lab/WSChuan-ASR

Duplicated by: https://huggingface.co/spaces/huggingface-projects/repo_duplicator