vladsfa/ukr-dialects-audio-dataset
Ukrainian Dialects Audio Dataset Merged Ukrainian dialect speech dataset combining 5 speaker datasets, with train/validation/test splits. Dataset Description This dataset contains audio recordings of Ukrainian dialect speech, merged from the following source datasets: NaUKMA-Audio-Dataset Ivanna-Stefiuk-Audio-Dataset Larysa-Irodenko-Audio-Dataset Hutsulendia-Audio-Dataset Dido-Yvanchyk-Audio-Dataset-v2 Dataset Structure train: 27,675 samples… See the full description on the dataset page: https://huggingface.co/datasets/vladsfa/ukr-dialects-audio-dataset.
Ukrainian Dialects Audio Dataset
Merged Ukrainian dialect speech dataset combining 5 speaker datasets, with train/validation/test splits.
Dataset Description
This dataset contains audio recordings of Ukrainian dialect speech, merged from the following source datasets:
- NaUKMA-Audio-Dataset
- Ivanna-Stefiuk-Audio-Dataset
- Larysa-Irodenko-Audio-Dataset
- Hutsulendia-Audio-Dataset
- Dido-Yvanchyk-Audio-Dataset-v2
Dataset Structure
- train: 27,675 samples
- validation: 3,365 samples
- test: 3,451 samples
- Total: 34,491 samples
Features
audio: Audio file (16 kHz, mono)text: Original texttranscribed_text: Transcribed textsentence_id: Sentence identifiersegment: Segment identifierduration: Audio duration in secondsalignment_score: Alignment quality scoreword_count: Number of wordspart: Part identifier
Usage
from datasets import load_dataset
dataset = load_dataset("KSE-RESEARCH-Group/ukr-dialects-audio-dataset")License
CC-BY-4.0
