touati-kamel/algerian-arabic-english-translation-50k
Algerian Arabic (Darija) โ English Translation (50K) ๐ฉ๐ฟ An open-source parallel corpus of 50,000 Algerian Arabic (Darija) sentences paired with their English translations. Released to help the research community and developers build and evaluate NLP models, translation systems, and LLMs for Algerian Arabic / Maghrebi Dialect โ an under-resourced variety of Arabic. Use it freely for machine translation, LLM fine-tuning, evaluation, dialectal Arabic NLP, and data augmentation.โฆ See the full description on the dataset page: https://huggingface.co/datasets/touati-kamel/algerian-arabic-english-translation-50k.
Algerian Arabic (Darija) โ English Translation (50K) ๐ฉ๐ฟ
An open-source parallel corpus of 50,000 Algerian Arabic (Darija) sentences paired with their English translations. Released to help the research community and developers build and evaluate NLP models, translation systems, and LLMs for Algerian Arabic / Maghrebi Dialect โ an under-resourced variety of Arabic.
Use it freely for machine translation, LLM fine-tuning, evaluation, dialectal Arabic NLP, and data augmentation.
Dataset Structure
A single train split containing 50,000 aligned pairs across multiple convenient formats (.parquet, .csv, .jsonl, .json):
The pairs are aligned one-to-one, suitable for bidirectional translation (Algerian Darija โ English).
Files in data/
algerian_translation_50k.parquet(Recommended, 13 MB)algerian_translation_50k.csv(22.8 MB)algerian_translation_50k.jsonl(24.5 MB)algerian_translation_50k.json(25.6 MB)
Sample Translations
Usage
Loading with Pandas
import pandas as pd
# Load from parquet
df = pd.read_parquet("data/algerian_translation_50k.parquet")
print(df.head())Loading with HuggingFace datasets
from datasets import load_dataset
ds = load_dataset("json", data_files="data/algerian_translation_50k.jsonl")
print(ds["train"][0])Intended Uses
- Training and fine-tuning Algerian Arabic โ English translation models.
- Instruction fine-tuning LLMs (e.g. LLaMA, Mistral, Gemma, Qwen) for Maghrebi dialect comprehension and generation.
- Evaluation benchmarks for dialectal Arabic machine translation.
- Conversational data augmentation for speech recognition and chatbots.
License
Released under the Apache-2.0 license โ free to use, modify, and distribute.
