CoolFace
Modelpublic

espnet/wanchichen_fleurs_english_asr_wav2vec_frontend

sourceHugging Facecc-by-4.0updated 7d agoView on Hugging Face
1likes8downloads
Model Card

Usage

python
import librosa
from espnet2.bin.asr_inference import Speech2Text

speech2text = Speech2Text.from_pretrained(model_tag="espnet/wanchichen_fleurs_english_asr_wav2vec_frontend")
# librosa resamples and mixes to one channel, so any file works; 16000 is
# what nearly every espnet recogniser is trained on - check this model's
# config if its audio is not 16 kHz
speech, rate = librosa.load("audio.wav", sr=16000, mono=True)
text, *_ = speech2text(speech)[0]
print(text)

ESPnet2 ASR model

espnet/wanchichen_fleurs_english_asr_wav2vec_frontend

This model was trained by William Chen using the fleurs recipe in espnet.

Demo: How to use in ESPnet2

bash
cd espnet
pip install -e .
cd egs2/fleurs/asr1
./run.sh

<!-- Generated by scripts/utils/showasrresult.sh -->

RESULTS

Environments

  • —date: Sun Aug 14 14:52:04 EDT 2022
  • —python version: 3.8.6 (default, Dec 17 2020, 16:57:01) [GCC 10.2.0]
  • —espnet version: espnet 202205
  • —pytorch version: pytorch 1.8.1+cu102
  • —Git hash: 45e8cb9173a072f85ee7a7ccbcae06af7c5c484a
  • —Commit date: Wed Jun 1 14:21:14 2022 +0900

asrtrainasrwav2vec960htransformerrawenusbpe300sp

WER

datasetSntWrdCorrSubDelInsErrS.Err
decodeasrasrmodelvalid.acc.best/test_all6471434467.129.43.54.637.599.8
decodeasrasrmodelvalid.acc.best/dev_all388793566.829.73.65.038.299.0

CER

datasetSntWrdCorrSubDelInsErrS.Err
decodeasrasrmodelvalid.acc.best/test_all6478395488.65.46.04.816.299.8
decodeasrasrmodelvalid.acc.best/dev_all3884705188.16.05.94.416.399.0

TER

datasetSntWrdCorrSubDelInsErrS.Err
decodeasrasrmodelvalid.acc.best/test_all647399657.714.97.44.126.499.8
decodeasrasrmodelvalid.acc.best/dev_all3882249177.315.27.53.826.599.0