CoolFace
Modelpublic

TheKingMonarch/whisper-multilang-finetuned

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
1likes11downloads
Model Card

Whisper Multilingual Fine-tuned Model

This is a fine-tuned version of OpenAI's Whisper model for multilingual speech recognition.

Supported Languages

  • —English (en)
  • —Hindi (hi)
  • —Bengali (bn)
  • —Marathi (mr)
  • —Tamil (ta)
  • —Telugu (te)

Model Details

  • —Base Model: Distil Whisper Large V3
  • —Fine-tuned on: Custom multilingual dataset
  • —Training Framework: Transformers
  • —Model Type: Speech-to-Text

Usage

python
from transformers import WhisperProcessor, WhisperForConditionalGeneration
import librosa

# Load model and processor
processor = WhisperProcessor.from_pretrained("TheKingMonarch/whisper-multilang-finetuned")
model = WhisperForConditionalGeneration.from_pretrained("TheKingMonarch/whisper-multilang-finetuned")

# Fix generation config
model.generation_config.forced_decoder_ids = None

# Load audio
audio, _ = librosa.load("audio.wav", sr=16000)

# Transcribe
inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
predicted_ids = model.generate(inputs.input_features)
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)

Language-specific Usage

python
# For specific language (e.g., Hindi)
forced_decoder_ids = processor.get_decoder_prompt_ids(language="hi", task="transcribe")
predicted_ids = model.generate(inputs.input_features, forced_decoder_ids=forced_decoder_ids)

Training Details

  • —Fine-tuned using custom multilingual speech dataset
  • —Optimized for Indian languages and English
  • —Final WER: 27.08%
  • —Training Steps: 600
  • —Best WER achieved: 26.73% at step 550

Training Metrics

StepTraining LossValidation LossWER (%)
502.0750001.930286133.45
1001.2066001.27502789.54
1500.7938000.71247593.42
2000.5287000.56267988.92
2500.3799000.47346789.27
3000.2894000.36989269.88
3500.2443000.29123549.58
4000.2688000.24905542.80
4500.1222000.20986736.29
5000.0847000.17359331.44
5500.0734000.15524926.73
6000.0443000.14855927.08

Training Configuration

  • —Base Model: distil whispwer large v3
  • —Learning Rate: Optimized during training
  • —Batch Size: Configured for optimal performance
  • —Training Duration: 600 steps
  • —Evaluation Strategy: Every 50 steps
  • —Early Stopping: Based on WER improvement

Limitations

  • —Performance may vary across different accents and dialects
  • —Best results on clear audio with minimal background noise
  • —Optimized for the specific languages listed above

Citation

If you use this model, please cite:

@misc{{whisper-multilang-finetuned,
  author = {{Your Name}},
  title = {{Whisper Multilingual Fine-tuned Model}},
  year = {{2025}},
  publisher = {{Hugging Face}},
  url = {{https://huggingface.co/TheKingMonarch/whisper-multilang-finetuned}}
}}