DrIAmed/darija-youtube-dataset
Darija YouTube Dataset A dataset of Moroccan Arabic (Darija) speech scraped from YouTube, with transcriptions in Arabic script, Latin script (Arabizi), and English translations. Dataset Description This dataset contains sentence-level audio segments of Darija speech, paired with: Arabic transcription (modern Moroccan Arabic script) Latin transliteration (Arabizi format: 3=ع, 7=ح, 9=ق, etc.) English translation Columns Column Type Description… See the full description on the dataset page: https://huggingface.co/datasets/DrIAmed/darija-youtube-dataset.
Darija YouTube Dataset
A dataset of Moroccan Arabic (Darija) speech scraped from YouTube, with transcriptions in Arabic script, Latin script (Arabizi), and English translations.
Dataset Description
This dataset contains sentence-level audio segments of Darija speech, paired with:
- Arabic transcription (modern Moroccan Arabic script)
- Latin transliteration (Arabizi format: 3=ع, 7=ح, 9=ق, etc.)
- English translation
Columns
Example
How It Was Made
- Audio scraped from YouTube using
yt-dlp - Split into segments using silence detection
- Transcribed and translated using Gemini 2.5 native audio understanding
- Transliterated to Arabizi using rule-based mapping
Usage
from datasets import load_dataset
dataset = load_dataset("DrIAmed/darija-youtube-dataset")
print(dataset["train"][0])License
This dataset is provided for research purposes only.
