CoolFace
Datasetpublic

Arshia82sbn/Translation-Dataset-Large

Translation-Dataset_Large 🌍 A massive, unified multilingual parallel corpus for Persian, English, and Arabic NMT research. Translation-Dataset_Large aggregates and normalizes millions of sentence pairs across three language directions — English↔Persian (en-fa), Arabic↔English (ar-en), and Arabic↔Persian (ar-fa) — into a single, deduplicated, research-ready .parquet dataset. Dataset Summary Property Value Languages Persian (fa), English (en), Arabic… See the full description on the dataset page: https://huggingface.co/datasets/Arshia82sbn/Translation-Dataset-Large.

sourceHugging Facecc-by-nc-4.0updated 2mo agoView on Hugging Face
0likes278downloads
4 commits on main
cf577452mo ago

Upload folder using huggingface_hub

Arshia82sbn
b0583382mo ago

Update README.md

Arshia82sbn
df931da2mo ago

Upload translation_pairs_merged.parquet

Arshia82sbn
69882b02mo ago

initial commit

Arshia82sbn