CoolFace
Modelpublic

vitthalbhandari/xlsr-1b-aft-all-pne

sourceHugging Facecc-by-nc-4.0updated 7mo agoView on Hugging Face
0likes14downloads
Model Card

XLS-R 1B Adapter Fine-tuned for Western Penan

This model is a fine-tuned version of facebook/wav2vec2-xls-r-1b on the Mozilla Common Voice Spontaneous Speech dataset for Western Penan (pne).

Training

  • —Base model: facebook/wav2vec2-xls-r-1b
  • —Fine-tuning method: Attention adapter layers (adapterattndim=256)
  • —Dataset: Mozilla Common Voice Spontaneous Speech

Usage

python
from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
import torch

processor = Wav2Vec2Processor.from_pretrained("vitthalbhandari/xlsr-1b-aft-all-pne")
model = Wav2Vec2ForCTC.from_pretrained("vitthalbhandari/xlsr-1b-aft-all-pne")

# Transcribe audio
inputs = processor(audio_array, sampling_rate=16000, return_tensors="pt")
with torch.no_grad():
    logits = model(**inputs).logits
predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)