CoolFace
Modelpublic

gomyk/jina-v5-h256-distilled-conv

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes28downloads
Model Card

jina-v5-h256-distilled-conv

Lightweight multilingual sentence encoder compressed from `jinaai/jina-embeddings-v5-text-nano` (EuroBERT-210M, 12L/768d) via layer pruning + vocabulary pruning + knowledge distillation with conversation data.

Model Details

PropertyValue
Teacherjinaai/jina-embeddings-v5-text-nano (239M params)
ArchitectureEuroBERT (pruned)
Hidden dim256
Layers6 / 12
Intermediate1024
Model size (FP32)64.8 MB
Embedding dim256
Compression~3.7x (239M -> ~16M params)

Usage

python
from sentence_transformers import SentenceTransformer

model = SentenceTransformer("gomyk/jina-v5-h256-distilled-conv", trust_remote_code=True)
embeddings = model.encode(["Hello world", "How are you?"])
print(embeddings.shape)  # (2, 256)

Training

Stage 1: Architecture Compression

  • —Teacher: jinaai/jina-embeddings-v5-text-nano (12 layers, 768d, 128K vocab)
  • —Layer pruning: 12 -> 6 layers
  • —Dimension reduction: 768d -> 256d
  • —Vocabulary pruning: BPE merge-backtracked corpus-based filtering

Stage 2: Knowledge Distillation

  • —Method: MSE + Cosine Similarity loss (MSE weight=1.0, Cosine weight=0.5)
  • —Data: MTEB task datasets (~1.4M) + conversation data (~19.5M) = ~20.9M texts
  • —Optimizer: AdamW (lr=2e-5, weight_decay=0.01)
  • —Schedule: Cosine annealing
  • —Training: ~2.5 epochs (1.37M global steps), best loss=0.0232
  • —Projection: Learnable linear projection 256d -> 768d for distillation

MTEB Evaluation Results

Overall Average: 56.29%

Task GroupAverage
Classification63.86%
Clustering32.62%
STS70.60%

Classification

TaskScore
AmazonCounterfactualClassification72.81%
Banking77Classification77.90%
ImdbClassification73.39%
MTOPDomainClassification86.91%
MassiveIntentClassification32.96%
MassiveScenarioClassification40.19%
ToxicConversationsClassification62.45%
TweetSentimentExtractionClassification64.25%

Clustering

TaskScore
ArXivHierarchicalClusteringP2P48.36%
ArXivHierarchicalClusteringS2S46.85%
BiorxivClusteringP2P.v218.36%
MedrxivClusteringP2P.v224.59%
MedrxivClusteringS2S.v223.35%
StackExchangeClustering.v242.75%
StackExchangeClusteringP2P.v233.83%
TwentyNewsgroupsClustering.v222.86%

STS (Semantic Textual Similarity)

TaskScore
BIOSSES63.87%
SICK-R81.44%
STS1275.81%
STS1376.53%
STS1477.58%
STS1584.28%
STS1757.45%
STS22.v234.21%
STSBenchmark84.20%