cvas-544/autotinglishsub-whisper-telugu
AutoTinglishSub – Whisper Telugu Tinglish Fine-Tune
Overview
cvas-544/autotinglishsub-whisper-telugu is a fine-tuned Automatic Speech Recognition (ASR) model optimized for Tinglish — Telugu and Indian English code-mixed speech.
This model is designed specifically for subtitle generation workflows in short-form content such as Reels, TikTok, and YouTube Shorts.
It improves transcription quality for:
- Telugu conversational speech
- Indian English accents
- Telugu-English code-switching
- Fast-paced creator-style delivery
- Informal spoken content
Model Lineage
This model is fine-tuned from:
vasista22/whisper-telugu-large-v2(Apache 2.0)
Which itself is fine-tuned from:
openai/whisper-large-v2(MIT License)
This model continues that lineage with further optimization for Tinglish subtitle workflows.
Intended Use
Primary use cases:
- Subtitle generation for short-form video
- Creator-focused ASR pipelines
- Local CLI subtitle tools
- Tinglish speech recognition
- Code-switched Telugu + English audio
The model is optimized for conversational and creator-style speech rather than formal Telugu literature.
Training Summary
- Fine-tuning performed on Tinglish-focused dataset
- Total training chunks used: 120
- Objective: Improve transcription accuracy for Telugu + Indian English mixed speech
- Focus on subtitle-ready clean outputs
Evaluation Metrics
Word Error Rate (WER)
Details:
- Measured after first fine-tuning phase
- Evaluated on held-out validation split
- Based on 120 training chunks
- Metric computed using standard WER calculation (substitutions + insertions + deletions / total words)
This represents a significant improvement in handling Tinglish code-mixed speech compared to the base Telugu fine-tuned model in informal creator-style audio.
Usage
Using Transformers Pipeline
import torch
from transformers import pipeline
audio = "/path/to/audio.wav"
device = "cuda:0" if torch.cuda.is_available() else "cpu"
transcribe = pipeline(
task="automatic-speech-recognition",
model="cvas-544/autotinglishsub-whisper-telugu",
chunk_length_s=30,
device=device
)
print("Transcription:", transcribe(audio)["text"])