espnet/wanchichen_fleurs_english_asr_wav2vec_frontend
18
Usage
import librosa
from espnet2.bin.asr_inference import Speech2Text
speech2text = Speech2Text.from_pretrained(model_tag="espnet/wanchichen_fleurs_english_asr_wav2vec_frontend")
# librosa resamples and mixes to one channel, so any file works; 16000 is
# what nearly every espnet recogniser is trained on - check this model's
# config if its audio is not 16 kHz
speech, rate = librosa.load("audio.wav", sr=16000, mono=True)
text, *_ = speech2text(speech)[0]
print(text)ESPnet2 ASR model
espnet/wanchichen_fleurs_english_asr_wav2vec_frontend
This model was trained by William Chen using the fleurs recipe in espnet.
Demo: How to use in ESPnet2
cd espnet
pip install -e .
cd egs2/fleurs/asr1
./run.sh<!-- Generated by scripts/utils/showasrresult.sh -->
RESULTS
Environments
- date:
Sun Aug 14 14:52:04 EDT 2022 - python version:
3.8.6 (default, Dec 17 2020, 16:57:01) [GCC 10.2.0] - espnet version:
espnet 202205 - pytorch version:
pytorch 1.8.1+cu102 - Git hash:
45e8cb9173a072f85ee7a7ccbcae06af7c5c484a - Commit date:
Wed Jun 1 14:21:14 2022 +0900
