LocalDoc/azerbaijani_asr
Azerbaijani ASR Dataset Dataset Description This dataset contains Azerbaijani speech data for Automatic Speech Recognition (ASR) tasks. Dataset Summary Language: Azerbaijani (az) Task: Automatic Speech Recognition Total Duration: ~328 hours Total Samples: ~345,643 audio-text pairs Audio Format: WAV, 16kHz sampling rate License: CC-BY-4.0 Dataset Structure Each audio segment is specially numbered so that you can merge them if you… See the full description on the dataset page: https://huggingface.co/datasets/LocalDoc/azerbaijani_asr.
Azerbaijani ASR Dataset
Dataset Description
This dataset contains Azerbaijani speech data for Automatic Speech Recognition (ASR) tasks.
Dataset Summary
- Language: Azerbaijani (az)
- Task: Automatic Speech Recognition
- Total Duration: ~328 hours
- Total Samples: ~345,643 audio-text pairs
- Audio Format: WAV, 16kHz sampling rate
- License: CC-BY-4.0
Dataset Structure
Each audio segment is specially numbered so that you can merge them if you need to create longer segments.
DatasetDict({
train: Dataset({
features: ['audio', 'text', 'duration', 'audio_file'],
num_rows: [total_samples]
})
})Features
audio: Audio file (WAV format, 16kHz)text: Transcription of the audio (Azerbaijani text)duration: Duration of audio clip in secondsaudio_file: Original filename of the audio segment
Usage
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("LocalDoc/azerbaijani_asr")
# Access train split
train_dataset = dataset["train"]
# Example usage
for example in train_dataset:
audio = example["audio"]
text = example["text"]
duration = example["duration"]Duration Distribution
- 0-2 sec: 36.1%
- 2-5 sec: 47.2%
- 5-10 sec: 14.6%
- 10-20 sec: 2.0%
- 20+ sec: 0.1%
Use Cases
- Fine-tuning Whisper models for Azerbaijani
- Training new ASR models for Azerbaijani language
- Benchmarking ASR performance on Azerbaijani
Citation
If you use this dataset, please cite:
@dataset{azerbaijani_asr_2025,
title={Azerbaijani ASR Dataset},
author={LocalDoc},
year={2025},
url={https://huggingface.co/datasets/LocalDoc/azerbaijani_asr}
}