CoolFace
Modelpublic

Sa1Krishna/sema-whisper-large-v3-hindi-finetuned

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes
Model Card

Whisper Large V3 โ€” Hindi Fine-tuned ๐ŸŽ™๏ธ

Fine-tuned version of openai/whisper-large-v3 for Hindi speech recognition using LoRA (PEFT).

Model Details

ParameterValue
Base Modelopenai/whisper-large-v3
DatasetSPRINGLab/IndicVoices-R_Hindi
Train Samples~14,800
Eval Samples~740
Training Steps4400
Best Val Loss0.1167
LoRA Rank8
LoRA Alpha16
Baseline WER32.10%
Fine-tuned WER28.98%
MethodLoRA fine-tuning (PEFT)
Precisionbfloat16

Usage

python
from transformers import pipeline

asr = pipeline(
    task='automatic-speech-recognition',
    model='Sa1Krishna/sema-whisper-large-v3-hindi-finetuned',
    chunk_length_s=30,
    device=0
)

result = asr(
    'hindi_audio.wav',
    generate_kwargs={
        'language': 'hindi',
        'task': 'transcribe'
    }
)
print(result['text'])

Training Details

Trained on SPRINGLab/IndicVoices-R_Hindi โ€” a large scale Hindi speech dataset with diverse speakers.

Training Config

  • โ€”Optimizer : AdamW
  • โ€”LR : 1e-4
  • โ€”Batch size : 16 (effective)
  • โ€”Precision : bfloat16
  • โ€”Framework : HuggingFace Transformers + PEFT

Limitations

  • โ€”Optimised for Hindi speech only
  • โ€”May struggle with heavy accents
  • โ€”Short utterances work best