nezahatkorkmaz/turkce-embedding-bge-m3
116.6k
🇹🇷 Turkish Embedding Model (bge-m3 Fine-tuned)
This model is a Turkish fine-tuned version of BAAI/bge-m3, optimized for Turkish semantic similarity, retrieval, and RAG (Retrieval-Augmented Generation) tasks. It maps Turkish sentences and paragraphs into a 1024-dimensional dense vector space.
Model Overview
Evaluation Results
Model was evaluated on a Turkish Semantic Textual Similarity (STS) dataset. Compared to the base multilingual BGE-M3 model, the fine-tuned model shows a notable improvement in Pearson correlation, indicating better alignment between cosine similarity scores and human judgments.
The model demonstrates higher linear correlation on Turkish STS benchmarks, producing more consistent semantic scores for Turkish-language retrieval and ranking tasks.
Quick Example
from sentence_transformers import SentenceTransformer, util
model = SentenceTransformer("nezahatkorkmaz/turkce-embedding-bge-m3")
s1 = "Türkiye'nin başkenti Ankara'dır"
s2 = "Ankara Türkiye'nin başşehridir"
emb1, emb2 = model.encode([s1, s2], normalize_embeddings=True)
score = util.cos_sim(emb1, emb2).item()
print(f"Cosine similarity: {score:.4f}")
# Expected output ≈ 0.75–0.80