awaaz-se-alfaaz/whisper-turbo-v3-urdu
Awaaz se Alfaaz — Whisper-Large-v3-Turbo LoRA (Urdu ASR)
LoRA fine-tuned adapter for Urdu automatic speech recognition, built on openai/whisper-large-v3-turbo. Accepted at LaTeLL 2026 — Enhancing Urdu ASR with Whisper v3: Fine-Tuning on Latest Datasets and Realistic Multi-Speaker Evaluation with SLM Post-Processing.
Usage
!pip install -U "torchao>=0.16.0" peft
from transformers import WhisperProcessor, WhisperForConditionalGeneration
from peft import PeftModel
base = WhisperForConditionalGeneration.from_pretrained("openai/whisper-large-v3-turbo")
model = PeftModel.from_pretrained(base, "awaaz-se-alfaaz/whisper-turbo-v3-urdu")
processor = WhisperProcessor.from_pretrained("awaaz-se-alfaaz/whisper-turbo-v3-urdu")Results
Benchmark WER (%) — LoRA fine-tuning | Dataset | Whisper-Turbo (Zero-Shot) | Whisper-Turbo (Fine-Tuned) | Relative Reduction | |---|---|---|---| | CSaLT | 27.51 | 20.77 | 24.5% | | Common Voice v23 | 37.23 | 25.78 | 30.8% | | FLEURS | 24.07 | 16.86 | 29.9% |
YouTube Evaluation Set (real-world, multi-speaker) | Model | WER (%) | |---|---| | Whisper-Turbo | 25.33 | | Whisper-Turbo Fine-Tuned | 24.20 |
SLM Post-Processing on YouTube Set | SLM Corrector | Whisper-Turbo | Whisper-Turbo Fine-Tuned | |---|---|---| | Gemma3-12B (4-bit) | 21.93 | 21.75 | | Qwen3-14B (4-bit) | 23.58 | 22.39 | | Tiny-Aya-Fire | 28.81 | 24.64 | | Qwen3-4B | 30.57 | 29.41 |
Citation
[BibTeX once camera-ready is finalized]
