CoolFace
Datasetpublic

Center-of-Advanced-Software-Technologies/mush_hy

Mush dataset An audio–transcription alignment dataset for the Mush dialect of Armenian. It contains approximately 4.5 hours of speech distributed across three splits: Train: 4,830 samples Validation (Dev): 117 samples Test: 650 samples Content Each example includes: audio: a WAV audio file transcription: the Armenian transcription text duration: audio duration in seconds

sourceHugging Facecc-by-4.0updated 7mo agoView on Hugging Face
0likes8downloads
Dataset Card

Mush dataset

An audio–transcription alignment dataset for the Mush dialect of Armenian.

It contains approximately 4.5 hours of speech distributed across three splits:

  • —Train: 4,830 samples
  • —Validation (Dev): 117 samples
  • —Test: 650 samples

Content

Each example includes:

  • —audio: a WAV audio file
  • —transcription: the Armenian transcription text
  • —duration: audio duration in seconds