KSE-RESEARCH-Group/whisper-small-ukr-dialects
127
whisper-small - Fine-tuned for Ukrainian ASR
This model is a fine-tuned version of openai/whisper-small on the ukr dialects audio dataset for Ukrainian speech recognition.
Model Description
Fine-tune openai/whisper-small on ukr-dialects-audio-dataset
Training Details
Training Data
Training Hyperparameters
Training Results
The model was trained for 5000 steps with evaluation every 500 steps. The best checkpoint was selected based on the lowest CER.
Best Model Checkpoint: Step 4500
Final Evaluation Metrics
Validation Set
Test Set
Usage
Using Pipeline (Recommended)
from transformers import pipeline
import torch
device = "cuda:0" if torch.cuda.is_available() else "cpu"
pipe = pipeline(
"automatic-speech-recognition",
model="KSE-RESEARCH-Group/whisper-small-ukr-dialects",
device=device,
)
result = pipe(
"path/to/audio.wav",
generate_kwargs={
"task": "transcribe",
"language": "ukrainian",
},
chunk_length_s=30,
)
print(result["text"])Using Transformers Directly
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import torch
model_id = "KSE-RESEARCH-Group/whisper-small-ukr-dialects"
processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(model_id)
# Move to GPU if available
device = "cuda:0" if torch.cuda.is_available() else "cpu"
model = model.to(device)
# Process audio (audio_array should be a numpy array at 16kHz)
input_features = processor(
audio_array,
sampling_rate=16000,
return_tensors="pt"
).input_features.to(device)
# Generate transcription
predicted_ids = model.generate(input_features)
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)Infrastructure
Hardware
Environment
Training Time
Experiment Details
Citation
If you use this model, please cite:
@misc{KSE-RESEARCH-Group-whisper-small-ukr-dialects,
author = {KSE-RESEARCH-Group},
title = {whisper-small - Fine-tuned for Ukrainian ASR},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/KSE-RESEARCH-Group/whisper-small-ukr-dialects}
}License
This model is released under the Apache 2.0 license.
Acknowledgements
- Base model: openai/whisper-small
- Dataset: ukr dialects audio dataset
- Training infrastructure: NVIDIA GeForce RTX 4090
