nileq/kazakh-omni-asr-ctc
024
Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)
Казак тіліндегі автоматты дыбыс тану моделі (ASR) — OmniASR wav2vec2 негізінде CTC loss-пен fine-tuned.
Model Details
- База: omnilingual-asr / wav2vec2.5 large
- Фреймворк: fairseq2
- Архитектура: Wav2Vec2ForCTC (24 encoder layers, 1024 hidden, 16 heads)
- Vocab size: 9812 (SentencePiece)
- Training steps: 20,000
- Best training loss: -21.70
- Sampling rate: 16kHz mono
Usage
from transformers import AutoModelForCTC, AutoProcessor
import torch
model = AutoModelForCTC.from_pretrained("nileq/kazakh-omni-asr-ctc")
processor = AutoProcessor.from_pretrained("nileq/kazakh-omni-asr-ctc")
# 16kHz аудио
import soundfile as sf
speech, _ = sf.read("kazakh_audio.wav")
inputs = processor(speech, sampling_rate=16000, return_tensors="pt", padding=True)
with torch.no_grad():
logits = model(inputs.input_values).logits
predicted_ids = torch.argmax(logits, dim=-1)
transcription = processor.batch_decode(predicted_ids)
print(transcription[0])Citation
Если используете модель в работе:
@misc{nurislam2025kazahasr,
title={Kazakh ASR — Wav2Vec2 CTC (OmniASR fine-tuned)},
author={Nurislam},
year={2025},
howpublished={\url{https://huggingface.co/nileq/kazakh-omni-asr-ctc}}
}