CoolFace
Modelpublic

nezahatkorkmaz/turkce-embedding-bge-m3

sourceHugging Faceupdated 1y agoView on Hugging Face
11likes6.6kdownloads
Model Card

🇹🇷 Turkish Embedding Model (bge-m3 Fine-tuned)

This model is a Turkish fine-tuned version of BAAI/bge-m3, optimized for Turkish semantic similarity, retrieval, and RAG (Retrieval-Augmented Generation) tasks. It maps Turkish sentences and paragraphs into a 1024-dimensional dense vector space.


Model Overview

PropertyValue
Base ModelBAAI/bge-m3
ArchitectureXLM-RoBERTa + Pooling + Normalize
Embedding Dimension1024
Max Sequence Length8192
Similarity FunctionCosine
Loss FunctionsMultipleNegativesRankingLoss + TripletLoss
LanguageTurkish 🇹🇷
Use CasesSemantic Search, Text Similarity, RAG, Clustering

Evaluation Results

Model was evaluated on a Turkish Semantic Textual Similarity (STS) dataset. Compared to the base multilingual BGE-M3 model, the fine-tuned model shows a notable improvement in Pearson correlation, indicating better alignment between cosine similarity scores and human judgments.

MetricBase (BAAI/bge-m3)Fine-tunedΔ (Change)
Spearman (ρ)0.68140.6839+0.0025
Pearson (r)0.85350.9096+0.0561
The model demonstrates higher linear correlation on Turkish STS benchmarks, producing more consistent semantic scores for Turkish-language retrieval and ranking tasks.

Quick Example

python
from sentence_transformers import SentenceTransformer, util

model = SentenceTransformer("nezahatkorkmaz/turkce-embedding-bge-m3")

s1 = "Türkiye'nin başkenti Ankara'dır"
s2 = "Ankara Türkiye'nin başşehridir"

emb1, emb2 = model.encode([s1, s2], normalize_embeddings=True)
score = util.cos_sim(emb1, emb2).item()
print(f"Cosine similarity: {score:.4f}")
# Expected output ≈ 0.75–0.80