Center-of-Advanced-Software-Technologies/mush_hy
Mush dataset An audio–transcription alignment dataset for the Mush dialect of Armenian. It contains approximately 4.5 hours of speech distributed across three splits: Train: 4,830 samples Validation (Dev): 117 samples Test: 650 samples Content Each example includes: audio: a WAV audio file transcription: the Armenian transcription text duration: audio duration in seconds
08
Mush dataset
An audio–transcription alignment dataset for the Mush dialect of Armenian.
It contains approximately 4.5 hours of speech distributed across three splits:
- Train: 4,830 samples
- Validation (Dev): 117 samples
- Test: 650 samples
Content
Each example includes:
- audio: a WAV audio file
- transcription: the Armenian transcription text
- duration: audio duration in seconds
