CoolFace
Datasetpublic

dogdoh/dari-enko-corpus-sample

Dari EN↔KO Technical Translation Corpus (Sample) 🌉 Dari (다리, "bridge") — 67M+ EN↔KO parallel sentence pairs for technical translation. Dataset Description This is a 10,000-pair sample from the full Dari corpus. The full corpus contains 67.2 million high-quality EN↔KO parallel segments across multiple technical domains. Domains Domain Full Corpus Pairs Patent (KIPRIS) 15M+ Medical (PubMed) 12M+ IT/Software 10M+ Legal 8M+ General… See the full description on the dataset page: https://huggingface.co/datasets/dogdoh/dari-enko-corpus-sample.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes12downloads
settings

This repository belongs to dogdoh on Hugging Face.

CoolFace never edits a repository it does not host. Visibility, licence, collaborators and gating are all managed at the source.

namedari-enko-corpus-sample
visibilitypublic
licencecc-by-4.0
gatedno
ownerdogdoh
Account settings
dogdoh/dari-enko-corpus-sample · CoolFace