CoolFace
Modelpublic

hsaim/whisper-tiny-minds14-en-us-output

sourceHugging Faceupdated 10d agoView on Hugging Face
0likes26downloads
Model Card

language:

  • —en license: apache-2.0 base_model: openai/whisper-tiny tags:
  • —automatic-speech-recognition
  • —whisper
  • —audio
  • —generatedfromtrainer datasets:
  • —PolyAI/minds14 pipeline_tag: automatic-speech-recognition

Fine-tuned Whisper Tiny for MInDS-14 (en-US)

This model fine-tunes `openai/whisper-tiny` for automatic speech recognition on the American English (en-US) subset of the `PolyAI/minds14` dataset.

Model description

Whisper Tiny is a compact encoder-decoder Transformer model for speech recognition. This version was fine-tuned to transcribe short English spoken queries from the MInDS-14 dataset.

Training data

  • —Dataset: PolyAI/minds14
  • —Configuration: en-US
  • —Training examples: first 450 examples
  • —Evaluation examples: remaining 113 examples
  • —Audio sampling rate: 16 kHz

Training procedure

SettingValue
Base modelopenai/whisper-tiny
TaskAutomatic speech recognition
LanguageEnglish
Epochs10
Learning rate1e-5
Train batch size4
Gradient accumulation steps4
Effective batch size16
Optimizer selection metricNormalized WER

Evaluation results

The model was evaluated on the held-out 113 examples.

MetricScore
Normalized WER0.2993
Orthographic WER0.2961

Lower Word Error Rate (WER) is better. A normalized WER of 0.2993 corresponds to approximately 29.93% word error.

Usage

python
from transformers import pipeline

pipe = pipeline(
    "automatic-speech-recognition",
    model="hsaim/whisper-tiny-minds14-en-us-output",
)

result = pipe("path/to/audio.wav")
print(result["text"])

Limitations

This is an educational fine-tuning run using a small dataset. It is intended for experimentation and may perform poorly on long recordings, noisy audio, different accents, languages other than English, or domains unlike MInDS-14 spoken queries.