CoolFace
Modelpublic

biswa921/wav2vec2-clsril-23-10k-telugu-init

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes13downloads
Model Card

Model Card for Model ID

<!-- Provide a quick summary of what the model is/does. -->

Wav2Vec2 Telugu ASR

This is a initialised for telugu fine-tuning from Harveenchadha/wav2vec2-pretrained-clsril-23-10k.

  • —Language: Telugu (te-IN)
  • —Model Type: CTC-based Automatic Speech Recognition (ASR)
  • —Base Model: Harveenchadha/wav2vec2-pretrained-clsril-23-10k
  • —Vocabulary: Custom Telugu character-level vocab

Note: This is a pre-trained base model prepared for fine-tuning. It should not be used for inference until fine-tuned.


Inference Usage

python
import torch, torchaudio
from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor

# Load processor and model
processor = Wav2Vec2Processor.from_pretrained("biswa921/wav2vec2-clsril-23-10k-telugu-init")
model = Wav2Vec2ForCTC.from_pretrained("biswa921/wav2vec2-clsril-23-10k-telugu-init")

# Load audio file
audio_input, sample_rate = torchaudio.load("/path/to/audio.wav")  # should be 16kHz mono

# Preprocess and run inference
input_values = processor(audio_input.squeeze(), sampling_rate=sample_rate, return_tensors="pt").input_values
logits = model(input_values).logits
predicted_ids = torch.argmax(logits, dim=-1)

# Decode transcription
transcription = processor.decode(predicted_ids[0], skip_special_tokens=True)
print(transcription)