KSE-RESEARCH-Group/whisper-medium-dido-yvanchyk-v2
022
whisper-medium - Fine-tuned for Ukrainian ASR
This model is a fine-tuned version of openai/whisper-medium on the Dido Yvanchyk Audio Dataset v2 for Ukrainian speech recognition.
Model Description
Fine-tune openai/whisper-medium on Dido-Yvanchyk dataset
Training Details
Training Data
Training Hyperparameters
Training Results
The model was trained for 8000 steps with evaluation every 500 steps. The best checkpoint was selected based on the lowest CER.
Best Model Checkpoint: Step 7000
Final Evaluation Metrics
Validation Set
Test Set
Usage
Using Pipeline (Recommended)
from transformers import pipeline
import torch
device = "cuda:0" if torch.cuda.is_available() else "cpu"
pipe = pipeline(
"automatic-speech-recognition",
model="KSE-RESEARCH-Group/whisper-medium-dido-yvanchyk-v2",
device=device,
)
result = pipe(
"path/to/audio.wav",
generate_kwargs={
"task": "transcribe",
"language": "ukrainian",
},
chunk_length_s=30,
)
print(result["text"])Using Transformers Directly
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import torch
model_id = "KSE-RESEARCH-Group/whisper-medium-dido-yvanchyk-v2"
processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(model_id)
# Move to GPU if available
device = "cuda:0" if torch.cuda.is_available() else "cpu"
model = model.to(device)
# Process audio (audio_array should be a numpy array at 16kHz)
input_features = processor(
audio_array,
sampling_rate=16000,
return_tensors="pt"
).input_features.to(device)
# Generate transcription
predicted_ids = model.generate(input_features)
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)Infrastructure
Hardware
Environment
Training Time
Experiment Details
Citation
If you use this model, please cite:
@misc{KSE-RESEARCH-Group-whisper-medium-dido-yvanchyk-v2,
author = {KSE-RESEARCH-Group},
title = {whisper-medium - Fine-tuned for Ukrainian ASR},
year = {2025},
publisher = {Hugging Face},
url = {https://huggingface.co/KSE-RESEARCH-Group/whisper-medium-dido-yvanchyk-v2}
}License
This model is released under the MIT license.
Acknowledgements
- Base model: openai/whisper-medium
- Dataset: Dido Yvanchyk Audio Dataset v2
- Training infrastructure: NVIDIA GeForce RTX 4090
