CoolFace
Datasetpublic

vladsfa/ukr-dialects-audio-dataset

Ukrainian Dialects Audio Dataset Merged Ukrainian dialect speech dataset combining 5 speaker datasets, with train/validation/test splits. Dataset Description This dataset contains audio recordings of Ukrainian dialect speech, merged from the following source datasets: NaUKMA-Audio-Dataset Ivanna-Stefiuk-Audio-Dataset Larysa-Irodenko-Audio-Dataset Hutsulendia-Audio-Dataset Dido-Yvanchyk-Audio-Dataset-v2 Dataset Structure train: 27,675 samples… See the full description on the dataset page: https://huggingface.co/datasets/vladsfa/ukr-dialects-audio-dataset.

sourceHugging Facecc-by-4.0updated 13d agoView on Hugging Face
0likes75downloads
Dataset Card

Ukrainian Dialects Audio Dataset

Merged Ukrainian dialect speech dataset combining 5 speaker datasets, with train/validation/test splits.

Dataset Description

This dataset contains audio recordings of Ukrainian dialect speech, merged from the following source datasets:

Dataset Structure

  • train: 27,675 samples
  • validation: 3,365 samples
  • test: 3,451 samples
  • Total: 34,491 samples

Features

  • audio: Audio file (16 kHz, mono)
  • text: Original text
  • transcribed_text: Transcribed text
  • sentence_id: Sentence identifier
  • segment: Segment identifier
  • duration: Audio duration in seconds
  • alignment_score: Alignment quality score
  • word_count: Number of words
  • part: Part identifier

Usage

python
from datasets import load_dataset

dataset = load_dataset("KSE-RESEARCH-Group/ukr-dialects-audio-dataset")

License

CC-BY-4.0