CoolFace
Modelpublic

axondendriteplus/Legal-Embed-bge-base-en-v1.5

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
3likes1.2kdownloads
Model Card

Legal-Embed-bge-base-en-v1.5

This repository hosts a fine-tuned version of BAAI/bge-base-en-v1.5 optimized for legal document (text) retrieval and Retrieval-Augmented Generation (RAG) tasks.

Model Details

Evaluation (NDCG@10)

DimensionBaselineFine-tunedImprovement (%)
7680.61050.64125.03
5120.60370.63795.67
2560.58530.62687.08
1280.52760.56527.13
640.44690.518716.07

Metrics include cosine accuracy, MRR, MAP and NDCG.

Training Configuration

  • —Epochs: 4
  • —Batch size: 32
  • —Learning rate: 2e-5
  • —Data: 1,456 train / 162 test samples
  • —Hardware: CUDA GPU with FlashAttention

Findings

  • —Maximum improvement: 16.07%
  • —Fine-tuned 64D vs Baseline 768D: -15.03%
  • —Fine-tuned 128D vs Baseline 768D: -7.41%
  • —Storage reduction with 128D: 6× smaller
  • —Storage reduction with 64D: 12× smaller
  • —Baseline best score: 0.6105
  • —Fine-tuned best score: 0.6412

Usage

python
from sentence_transformers import SentenceTransformer

model = SentenceTransformer("axondendriteplus/Legal-Embed-bge-base-en-v1.5")
embeddings = model.encode(["your legal text"])

Credits

Fine-tuning guide: https://www.philschmid.de/fine-tune-embedding-model-for-rag