CoolFace
Modelpublic

myandev/Whisper-Small-Myanmar-Partial-Freezing

sourceHugging Faceapache-2.0updated 7d agoView on Hugging Face
0likes19downloads
Model Card

Whisper Small Myanmar Partial Freezing

This model is a fine-tuned version of [openai/whisper-small](https://huggingface.co/openai/whisper-small) (244 Million parameters) dedicated for Myanmar (Burmese) speech recognition.

Whisper Small Myanmar Partial Freezing Benchmark Results

MetricBaseline (Zero-Shot)Fine-Tuned (Partial-Freezing)Net Improvement
CER (Character Error Rate)159.97%17.94%-142.03%
WER (Word Error Rate)317.49%56.31%-261.18%
Sentence Exact Match0.00%2.06%+2.06%
Evaluation Loss3.35311.5270-1.8261

Model & Training Architecture

  • —Base Architecture: openai/whisper-small (244M parameters, 12 encoder layers, 12 decoder layers)
  • —Strategy: Partial Encoder Freezing (Layers 0-7 frozen, Layers 8-11 + all 12 decoder layers trainable)
  • —Tonal Language Safeguards: Phase-vocoder speed perturbation (0.9x, 1.0x, 1.1x) + F0-protected SpecAugment (protecting 80-300Hz fundamental tone frequencies)
  • —Optimization: AdamW + Cosine Annealing Learning Rate Scheduler (Peak LR: 3.75e-5, 1000 Steps)
  • —Language Force Token: Burmese (<|my|>) with task='transcribe' and Unicode NFC normalization

Usage (Inference Pipeline)

python
import torch
from transformers import pipeline

# Load pipeline directly from HuggingFace
pipe = pipeline(
    "automatic-speech-recognition",
    model="thantzinphyo/whisper-small-myanmar-phase1",
    torch_dtype=torch.float16,
    device="cuda:0" if torch.cuda.is_available() else "cpu"
)

# Transcribe Burmese audio (16kHz WAV)
result = pipe("your_burmese_audio.wav", generate_kwargs={"language": "my", "task": "transcribe"})
print("Transcription:", result["text"])