CoolFace
Datasetpublic

Arshia82sbn/Translation-Dataset-Large

Translation-Dataset_Large 🌍 A massive, unified multilingual parallel corpus for Persian, English, and Arabic NMT research. Translation-Dataset_Large aggregates and normalizes millions of sentence pairs across three language directions — English↔Persian (en-fa), Arabic↔English (ar-en), and Arabic↔Persian (ar-fa) — into a single, deduplicated, research-ready .parquet dataset. Dataset Summary Property Value Languages Persian (fa), English (en), Arabic… See the full description on the dataset page: https://huggingface.co/datasets/Arshia82sbn/Translation-Dataset-Large.

sourceHugging Facecc-by-nc-4.0updated 2mo agoView on Hugging Face
0likes278downloads
filetranslation_pairs_merged.parquet608.2 MBdownload

Arshia82sbn/Translation-Dataset-Large · main · files are served by the source, never re-hosted here