LocalDoc/azerbaijani-whisper-turbo
1905
Azerbaijani Whisper Turbo
Fine-tuned openai/whisper-large-v3-turbo for Azerbaijani automatic speech recognition.
Performance
This model achieves 8% lower WER than whisper-large-v3 with nearly 2x faster inference.
Evaluated on FLEURS Azerbaijani test set.
Usage
import torch
import librosa
from transformers import WhisperProcessor, WhisperForConditionalGeneration
import soundfile as sf
import numpy as np
processor = WhisperProcessor.from_pretrained("LocalDoc/azerbaijani-whisper-turbo")
model = WhisperForConditionalGeneration.from_pretrained("LocalDoc/azerbaijani-whisper-turbo")
audio, sr = sf.read("audio.wav")
if len(audio.shape) > 1:
audio = audio.mean(axis=1)
audio = librosa.resample(np.asarray(audio, dtype=np.float32), orig_sr=sr, target_sr=16000)
sr = 16000
inputs = processor(audio, sampling_rate=sr, return_tensors="pt")
forced_ids = processor.get_decoder_prompt_ids(language="az", task="transcribe")
with torch.no_grad():
ids = model.generate(inputs.input_features, forced_decoder_ids=forced_ids)
text = processor.batch_decode(ids, skip_special_tokens=True)[0]
print(text)Note: Audio must be 16kHz mono. If your audio has a different sample rate, use librosa.resample() as shown above.Requirements
pip install transformers torch soundfile librosaWhich model to choose?
Benchmark Details
All models evaluated on FLEURS Azerbaijani test split (921 samples) with the same normalization (lowercase, no punctuation).
License
Apache 2.0 ---
