AhmedEladl/saudi-dialect-speech-female
π Saudi Dialectal Arabic Audio Dataset This repository contains cleaned, segmented, and dual-transcribed Arabic speech data intended for speech modeling, ASR benchmarking, and Text-to-Speech (TTS) fine-tuning. ποΈ Dataset Columns Column Description audio The audio chunk (22,050 Hz, mono WAV) duration Chunk duration in seconds base_transcription Transcript from the base Arabic ASR model dialectal_transcription Transcript from the Saudi-dialectalβ¦ See the full description on the dataset page: https://huggingface.co/datasets/AhmedEladl/saudi-dialect-speech-female.
π Saudi Dialectal Arabic Audio Dataset
This repository contains cleaned, segmented, and dual-transcribed Arabic speech data intended for speech modeling, ASR benchmarking, and Text-to-Speech (TTS) fine-tuning.
ποΈ Dataset Columns
π Transcription Models
The dataset includes dual transcriptions for comparison and training flexibility:
- Base Model: CohereLabs/cohere-transcribe-arabic-07-2026
- Dialectal Model: oddadmix/cohere-transcribe-arabic-07-2026-dialectal-v2
π Dataset Statistics
- Total Chunks: 4,963
- Total Audio Duration: 4.85 hours (17,475 seconds)
- Chunk Duration Constraints: 2.0s minimum to 12.0s maximum
π Citation
If you use this dataset in your research or projects, please cite it as follows:
@dataset{saudi_dialect_speech_v2,
author = {Ahmed Eladl},
title = {Saudi Dialectal Arabic Audio},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/AhmedEladl/saudi-dialect-speech-v2}
}π§ Contact
For any questions, issues, or inquiries regarding this dataset, please reach out:
- Email: aeladl.dev@gmail.com
