CoolFace
Datasetpublic

ehabnegm/masri-podcast-300h-egyptian-tts

Masri Podcast - Egyptian Arabic TTS corpus Multi-speaker Egyptian Arabic speech built from public Egyptian podcast episodes, cut into single-speaker clips with word-level timings. Format 24 kHz mono 16-bit FLAC, EBU R128 loudness-normalised, DeepFilterNet3 denoised clips 3-15 s, cut on pause boundaries, never mid-word word-level start/end for every word speaker_id is global across episodes (ECAPA embeddings + agglomerative clustering) Splits… See the full description on the dataset page: https://huggingface.co/datasets/ehabnegm/masri-podcast-300h-egyptian-tts.

sourceHugging Facecc-by-nc-4.0updated 21d agoView on Hugging Face
0likes90downloads
Dataset Card

Masri Podcast - Egyptian Arabic TTS corpus

Multi-speaker Egyptian Arabic speech built from public Egyptian podcast episodes, cut into single-speaker clips with word-level timings.

Format

  • —24 kHz mono 16-bit FLAC, EBU R128 loudness-normalised, DeepFilterNet3 denoised
  • —clips 3-15 s, cut on pause boundaries, never mid-word
  • —word-level start/end for every word
  • —speaker_id is global across episodes (ECAPA embeddings + agglomerative clustering)

Splits

validation holds out whole episodes. heldout_speakers holds out speakers used in nothing else - the only honest way to measure voice cloning.

Fields

audio, transcript, words, speaker_id, episode_id, channel, source, duration, snr_db, bandwidth_hz, asr_confidence, voice_consistency

Build gates

single speaker per clip; overlap/crosstalk regions removed; bandwidth >= 11 kHz; SNR >= 15 dB; no Latin characters; numerals verbalised into Egyptian words; diacritics stripped; ASR confidence gated.

Transcripts are ASR-generated (Soniox stt-async-v5) and are not human-verified. Audio is sourced from public YouTube podcasts; released for research use.