dogdoh/dari-enko-corpus-sample
Dari EN↔KO Technical Translation Corpus (Sample) 🌉 Dari (다리, "bridge") — 67M+ EN↔KO parallel sentence pairs for technical translation. Dataset Description This is a 10,000-pair sample from the full Dari corpus. The full corpus contains 67.2 million high-quality EN↔KO parallel segments across multiple technical domains. Domains Domain Full Corpus Pairs Patent (KIPRIS) 15M+ Medical (PubMed) 12M+ IT/Software 10M+ Legal 8M+ General… See the full description on the dataset page: https://huggingface.co/datasets/dogdoh/dari-enko-corpus-sample.
Dari EN↔KO Technical Translation Corpus (Sample)
🌉 Dari (다리, "bridge") — 67M+ EN↔KO parallel sentence pairs for technical translation.
Dataset Description
This is a 10,000-pair sample from the full Dari corpus. The full corpus contains 67.2 million high-quality EN↔KO parallel segments across multiple technical domains.
Domains
Files
data/sample.csv— 10,000 parallel EN↔KO sentence pairs (stratified by domain)data/glossary.csv— 5,000 bilingual term entriesdata/stats.csv— Domain distribution statistics
Quality Metrics
- LaBSE semantic similarity scores
- COMET translation quality scores
- Human quality ratings (0-1 scale)
Usage
from datasets import load_dataset
ds = load_dataset("dogdoh/dari-enko-corpus-sample")Full Corpus Access
🔗 API: dari.is-a.dev 📧 Contact: dogdoh1338@icloud.com
