ehabnegm/masri-podcast-300h-egyptian-tts
Masri Podcast - Egyptian Arabic TTS corpus Multi-speaker Egyptian Arabic speech built from public Egyptian podcast episodes, cut into single-speaker clips with word-level timings. Format 24 kHz mono 16-bit FLAC, EBU R128 loudness-normalised, DeepFilterNet3 denoised clips 3-15 s, cut on pause boundaries, never mid-word word-level start/end for every word speaker_id is global across episodes (ECAPA embeddings + agglomerative clustering) Splits… See the full description on the dataset page: https://huggingface.co/datasets/ehabnegm/masri-podcast-300h-egyptian-tts.
Masri Podcast - Egyptian Arabic TTS corpus
Multi-speaker Egyptian Arabic speech built from public Egyptian podcast episodes, cut into single-speaker clips with word-level timings.
Format
- 24 kHz mono 16-bit FLAC, EBU R128 loudness-normalised, DeepFilterNet3 denoised
- clips 3-15 s, cut on pause boundaries, never mid-word
- word-level start/end for every word
speaker_idis global across episodes (ECAPA embeddings + agglomerative clustering)
Splits
validation holds out whole episodes. heldout_speakers holds out speakers used in nothing else - the only honest way to measure voice cloning.
Fields
audio, transcript, words, speaker_id, episode_id, channel, source, duration, snr_db, bandwidth_hz, asr_confidence, voice_consistency
Build gates
single speaker per clip; overlap/crosstalk regions removed; bandwidth >= 11 kHz; SNR >= 15 dB; no Latin characters; numerals verbalised into Egyptian words; diacritics stripped; ASR confidence gated.
Transcripts are ASR-generated (Soniox stt-async-v5) and are not human-verified. Audio is sourced from public YouTube podcasts; released for research use.
