CoolFace
Modelpublic

cvas-544/autotinglishsub-whisper-telugu

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes17downloads
Model Card

AutoTinglishSub – Whisper Telugu Tinglish Fine-Tune

Overview

cvas-544/autotinglishsub-whisper-telugu is a fine-tuned Automatic Speech Recognition (ASR) model optimized for Tinglish — Telugu and Indian English code-mixed speech.

This model is designed specifically for subtitle generation workflows in short-form content such as Reels, TikTok, and YouTube Shorts.

It improves transcription quality for:

  • —Telugu conversational speech
  • —Indian English accents
  • —Telugu-English code-switching
  • —Fast-paced creator-style delivery
  • —Informal spoken content

Model Lineage

This model is fine-tuned from:

  • —vasista22/whisper-telugu-large-v2 (Apache 2.0)

Which itself is fine-tuned from:

  • —openai/whisper-large-v2 (MIT License)

This model continues that lineage with further optimization for Tinglish subtitle workflows.


Intended Use

Primary use cases:

  • —Subtitle generation for short-form video
  • —Creator-focused ASR pipelines
  • —Local CLI subtitle tools
  • —Tinglish speech recognition
  • —Code-switched Telugu + English audio

The model is optimized for conversational and creator-style speech rather than formal Telugu literature.


Training Summary

  • —Fine-tuning performed on Tinglish-focused dataset
  • —Total training chunks used: 120
  • —Objective: Improve transcription accuracy for Telugu + Indian English mixed speech
  • —Focus on subtitle-ready clean outputs

Evaluation Metrics

Word Error Rate (WER)

MetricValue
Word Error Rate (WER)15.1%

Details:

  • —Measured after first fine-tuning phase
  • —Evaluated on held-out validation split
  • —Based on 120 training chunks
  • —Metric computed using standard WER calculation (substitutions + insertions + deletions / total words)

This represents a significant improvement in handling Tinglish code-mixed speech compared to the base Telugu fine-tuned model in informal creator-style audio.


Usage

Using Transformers Pipeline

python
import torch
from transformers import pipeline

audio = "/path/to/audio.wav"
device = "cuda:0" if torch.cuda.is_available() else "cpu"

transcribe = pipeline(
    task="automatic-speech-recognition",
    model="cvas-544/autotinglishsub-whisper-telugu",
    chunk_length_s=30,
    device=device
)

print("Transcription:", transcribe(audio)["text"])