CoolFace
Modelpublic

nileq/kazakh-omni-asr-ctc

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes24downloads
Model Card

Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)

Казак тіліндегі автоматты дыбыс тану моделі (ASR) — OmniASR wav2vec2 негізінде CTC loss-пен fine-tuned.

Model Details

  • —База: omnilingual-asr / wav2vec2.5 large
  • —Фреймворк: fairseq2
  • —Архитектура: Wav2Vec2ForCTC (24 encoder layers, 1024 hidden, 16 heads)
  • —Vocab size: 9812 (SentencePiece)
  • —Training steps: 20,000
  • —Best training loss: -21.70
  • —Sampling rate: 16kHz mono

Usage

python
from transformers import AutoModelForCTC, AutoProcessor
import torch

model = AutoModelForCTC.from_pretrained("nileq/kazakh-omni-asr-ctc")
processor = AutoProcessor.from_pretrained("nileq/kazakh-omni-asr-ctc")

# 16kHz аудио
import soundfile as sf
speech, _ = sf.read("kazakh_audio.wav")

inputs = processor(speech, sampling_rate=16000, return_tensors="pt", padding=True)
with torch.no_grad():
    logits = model(inputs.input_values).logits

predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)
print(transcription[0])

Citation

Если используете модель в работе:

bibtex
@misc{nurislam2025kazahasr,
  title={Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)},
  author={Nurislam},
  year={2025},
  howpublished={\url{https://huggingface.co/nileq/kazakh-omni-asr-ctc}}
}