CoolFace
Datasetpublic

emircanerol/terminology-en-tr

terimler sözlüğü (terminology-en-tr) Veri Kümesi Özeti Bu veri kümesi, on beş bilimsel ve teknik alanda İngilizce–Türkçe terim eşleşmelerinden oluşan, alanlara ve alt alanlara göre hiyerarşik biçimde düzenlenmiş bir terminoloji sözlüğüdür. Özellik Değer Terim sayısı 11.878 Ana alan sayısı 15 Kaynak dil İngilizce (en) Hedef dil Türkçe (tr) Biçim Hiyerarşik JSON (all_terminology.json) ve düzleştirilmiş JSON Lines (terminology.jsonl)… See the full description on the dataset page: https://huggingface.co/datasets/emircanerol/terminology-en-tr.

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes19downloads
Dataset Card

terimler sözlüğü (terminology-en-tr)

Veri Kümesi Özeti

Bu veri kümesi, on beş bilimsel ve teknik alanda İngilizce–Türkçe terim eşleşmelerinden oluşan, alanlara ve alt alanlara göre hiyerarşik biçimde düzenlenmiş bir terminoloji sözlüğüdür.

ÖzellikDeğer
Terim sayısı11.878
Ana alan sayısı15
Kaynak dilİngilizce (en)
Hedef dilTürkçe (tr)
BiçimHiyerarşik JSON (all_terminology.json) ve düzleştirilmiş JSON Lines (terminology.jsonl)

Diller

Kayıtlar İngilizce terimden Türkçe karşılığına doğru yönlüdür. Değerler yalnızca terim içerir; tanım veya açıklama içermez.

Veri Kümesi Yapısı

Veri, iç içe geçmiş bir JSON nesnesidir. Değerleri dize (string) olan bir düğüm, bir yaprak terim grubudur ve "İngilizce": "Türkçe" biçiminde eşleşmeler barındırır. Değerleri nesne (object) olan bir düğüm ise bir kategoridir. Bu şema, ikinci, üçüncü ve dördüncü düzeyde alt başlıklara olanak tanır.

json
{
  "matematik": {
    "lineer cebir": {
      "matrisler": {
        "matrix": "matris",
        "determinant": "determinant"
      }
    }
  }
}

Veri kümesi iki eşdeğer biçimde sunulur:

  • —`all_terminology.json` — kaynak hiyerarşik biçim. Alanları ve alt başlıkları koruyan iç içe JSON nesnesi.
  • —`terminology.jsonl` — düzleştirilmiş biçim (veri kümesi görüntüleyicisi bu dosyayı kullanır). Her satır english, turkish, domain ve category alanlarını içeren bir kayıttır.

Düzleştirilmiş biçimdeki alanlar:

AlanTürAçıklama
englishstrİngilizce terim
turkishstrTürkçe karşılık
domainstrAna alan (örneğin fizik)
categorystrAlt başlık yolu, > ile ayrılmış (örneğin mekanik > kinematik)

Alanlar

Matematik, fizik, kimya, biyoloji, coğrafya, tıp, finans, bilgisayar bilimi, yapay zekâ, hukuk, psikoloji, felsefe, jeoloji, astronomi ve ekonomi.

Alanlar tematik alt başlıklara ayrılmıştır. Teknik alanlar ayrıca kısaltmalar için ayrı bir kısaltmalar grubu içerir (örneğin LoRA, RAG, MRI, GDP).

Kullanım

python
import json
from huggingface_hub import hf_hub_download

path = hf_hub_download(
    repo_id="emircanerol/terminology-en-tr",
    filename="all_terminology.json",
    repo_type="dataset",
)
data = json.load(open(path, encoding="utf-8"))

def walk(node):
    for key, value in node.items():
        if isinstance(value, dict):
            yield from walk(value)
        else:
            yield key, value  # (İngilizce, Türkçe)

pairs = dict(walk(data))
print(pairs["matrix"])  # matris

Düzleştirilmiş biçimi datasets kütüphanesiyle yüklemek için:

python
from datasets import load_dataset

ds = load_dataset("emircanerol/terminology-en-tr", split="train")
print(ds[0])  # {"english": ..., "turkish": ..., "domain": ..., "category": ...}

Kaynak Veri ve Doğrulama

Veri kümesi, doğrulama durumu bakımından iki gruba ayrılır:

1. Kaynak dosyadan doğrulanmış alanlar. Fizik, kimya, biyoloji, coğrafya, tıp ve finans alanları (toplam 5.202 terim), sağlanan İngilizce–Türkçe CSV sözlüklerinden alınmıştır. Bu alanlardaki her terim çifti, kaynak dosyadaki karşılığıyla programatik olarak karşılaştırılmış ve birebir uyumlu olduğu doğrulanmıştır.

2. Yerleşik terminolojiye dayandırılmış alanlar. Matematik, bilgisayar bilimi, yapay zekâ, hukuk, psikoloji, felsefe, jeoloji, astronomi ve ekonomi alanları ile tüm alanlardaki kısaltma grupları, akademik ve resmî Türkçe kaynaklarda (TDK, TÜBA ve ilgili meslek kuruluşlarının terim sözlükleri) yerleşik kullanıma dayandırılarak hazırlanmıştır. Bu içerik bağımsız bir kaynak dosyaya karşı doğrulanmamıştır.

Sınırlılıklar

  • —Veri kümesi kapsamlı değildir ve tam değildir. Bir terminoloji sözlüğü doğası gereği açık uçludur; belirli bir alanın tüm terimlerini içerme iddiası taşımaz.
  • —İkinci gruptaki alanlar bağımsız olarak doğrulanmamıştır. Bu alanlarda, oturmuş bir Türkçe karşılığı bulunmayan terimlerde tek bir standart karşılık belirlenmiş veya terim uluslararası biçimiyle bırakılmış olabilir.
  • —Bazı kısaltmalar birden çok anlama gelebilir; bu durumlar anahtarda parantez içinde ayrıştırılmıştır (örneğin LDA (linear discriminant analysis) ve LDA (latent Dirichlet allocation)).

Lisans

CSV kaynak dosyalarının kökeni kesin olarak bilinmediğinden bu veri kümesi için belirli bir lisans tanımlanmamıştır. Kullanımdan önce kaynak hakları değerlendirilmelidir.