CoolFace
Modelpublic

espnet/mediaspeech-fr-hubert

sourceHugging Facecc-by-4.0updated 7d agoView on Hugging Face
0likes
Model Card

Usage

python
import librosa
from espnet2.bin.asr_inference import Speech2Text

speech2text = Speech2Text.from_pretrained(model_tag="espnet/mediaspeech-fr-hubert")
# librosa resamples and mixes to one channel, so any file works; 16000 is
# what nearly every espnet recogniser is trained on - check this model's
# config if its audio is not 16 kHz
speech, rate = librosa.load("audio.wav", sr=16000, mono=True)
text, *_ = speech2text(speech)[0]
print(text)

<!-- Generated by scripts/utils/showasrresult.sh -->

RESULTS

Environments

  • —date: Tue Mar 22 13:50:31 UTC 2022
  • —python version: 3.7.11 (default, Jul 27 2021, 14:32:16) [GCC 7.5.0]
  • —espnet version: espnet 0.10.7a1
  • —pytorch version: pytorch 1.10.1
  • —Git hash: 1991a25855821b8b61d775681aa0cdfd6161bbc8
  • —Commit date: Mon Mar 21 22:19:19 2022 +0800

asrtrainasrhubertrawasbpe150_sp

WER

datasetSntWrdCorrSubDelInsErrS.Err
inferenceasrmodelvalid.acc.ave/devas2491007249.741.29.17.057.2100.0
inferenceasrmodelvalid.acc.ave/testas249992051.140.18.96.555.4100.0

CER

datasetSntWrdCorrSubDelInsErrS.Err
inferenceasrmodelvalid.acc.ave/devas2495867980.98.011.17.226.3100.0
inferenceasrmodelvalid.acc.ave/testas2495869482.17.210.87.125.0100.0

TER

datasetSntWrdCorrSubDelInsErrS.Err
inferenceasrmodelvalid.acc.ave/devas2493083769.519.011.56.336.8100.0
inferenceasrmodelvalid.acc.ave/testas2493094270.717.911.46.035.3100.0