CoolFace
Datasetpublic

AhmedEladl/saudi-dialect-speech-female

🌍 Saudi Dialectal Arabic Audio Dataset This repository contains cleaned, segmented, and dual-transcribed Arabic speech data intended for speech modeling, ASR benchmarking, and Text-to-Speech (TTS) fine-tuning. πŸ—‚οΈ Dataset Columns Column Description audio The audio chunk (22,050 Hz, mono WAV) duration Chunk duration in seconds base_transcription Transcript from the base Arabic ASR model dialectal_transcription Transcript from the Saudi-dialectal… See the full description on the dataset page: https://huggingface.co/datasets/AhmedEladl/saudi-dialect-speech-female.

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
1likes138downloads
Dataset Card

🌍 Saudi Dialectal Arabic Audio Dataset

This repository contains cleaned, segmented, and dual-transcribed Arabic speech data intended for speech modeling, ASR benchmarking, and Text-to-Speech (TTS) fine-tuning.


πŸ—‚οΈ Dataset Columns

ColumnDescription
audioThe audio chunk (22,050 Hz, mono WAV)
durationChunk duration in seconds
base_transcriptionTranscript from the base Arabic ASR model
dialectal_transcriptionTranscript from the Saudi-dialectal ASR model

πŸ“ Transcription Models

The dataset includes dual transcriptions for comparison and training flexibility:


πŸ“Š Dataset Statistics

  • β€”Total Chunks: 4,963
  • β€”Total Audio Duration: 4.85 hours (17,475 seconds)
  • β€”Chunk Duration Constraints: 2.0s minimum to 12.0s maximum

πŸ“œ Citation

If you use this dataset in your research or projects, please cite it as follows:

bibtex
@dataset{saudi_dialect_speech_v2,
  author = {Ahmed Eladl},
  title = {Saudi Dialectal Arabic Audio},
  year = {2026},
  publisher = {Hugging Face},
  url = {https://huggingface.co/datasets/AhmedEladl/saudi-dialect-speech-v2}
}

πŸ“§ Contact

For any questions, issues, or inquiries regarding this dataset, please reach out:

  • β€”Email: aeladl.dev@gmail.com