CoolFace
Datasetpublic

dogdoh/dari-enko-corpus-sample

Dari EN↔KO Technical Translation Corpus (Sample) 🌉 Dari (다리, "bridge") — 67M+ EN↔KO parallel sentence pairs for technical translation. Dataset Description This is a 10,000-pair sample from the full Dari corpus. The full corpus contains 67.2 million high-quality EN↔KO parallel segments across multiple technical domains. Domains Domain Full Corpus Pairs Patent (KIPRIS) 15M+ Medical (PubMed) 12M+ IT/Software 10M+ Legal 8M+ General… See the full description on the dataset page: https://huggingface.co/datasets/dogdoh/dari-enko-corpus-sample.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes12downloads
Dataset Card

Dari EN↔KO Technical Translation Corpus (Sample)

🌉 Dari (다리, "bridge") — 67M+ EN↔KO parallel sentence pairs for technical translation.

Dataset Description

This is a 10,000-pair sample from the full Dari corpus. The full corpus contains 67.2 million high-quality EN↔KO parallel segments across multiple technical domains.

Domains

DomainFull Corpus Pairs
Patent (KIPRIS)15M+
Medical (PubMed)12M+
IT/Software10M+
Legal8M+
General22M+

Files

  • —data/sample.csv — 10,000 parallel EN↔KO sentence pairs (stratified by domain)
  • —data/glossary.csv — 5,000 bilingual term entries
  • —data/stats.csv — Domain distribution statistics

Quality Metrics

  • —LaBSE semantic similarity scores
  • —COMET translation quality scores
  • —Human quality ratings (0-1 scale)

Usage

python
from datasets import load_dataset
ds = load_dataset("dogdoh/dari-enko-corpus-sample")

Full Corpus Access

TierPriceIncludes
Free$0This 10K sample
API Basic$49/mo50K chars/month, REST API
API Pro$199/mo500K chars/month, batch export
EnterpriseCustomFull corpus license, on-prem

🔗 API: dari.is-a.dev 📧 Contact: dogdoh1338@icloud.com