vrashad/az-legal-retrieval-xlm
21.2k
az-legal-retrieval-xlm
A sentence embedding model fine-tuned on Azerbaijani legislation for legal information retrieval. Built on xlm-roberta-base (278M params) and trained on 780K+ query-passage pairs with BM25-mined hard negatives scored by a cross-encoder reranker.
Matches BGE-m3 (568M) on MRR@10 while being 2x smaller and 4x faster.
Benchmark Results
Evaluated on 939 independent LLM-generated and validated queries over 262K legislative passages:
Usage
from sentence_transformers import SentenceTransformer, util
model = SentenceTransformer("vrashad/az-legal-retrieval-xlm")
query = "Şərab istehsalı növləri hansılardır?"
passages = [
"Hazırlanma texnologiyalarına görə şərablar təbii və xüsusi olur.",
"Torpaq vergisi torpaq sahəsinin ölçüsünə görə müəyyən edilir.",
]
q_emb = model.encode(query, normalize_embeddings=True)
p_embs = model.encode(passages, normalize_embeddings=True)
scores = util.cos_sim(q_emb, p_embs)[0]
for passage, score in zip(passages, scores):
print(f"{score:.4f} | {passage}")Training
Dataset
Training data: LocalDoc/azerbaijan_legislation_queries_passages
Source corpus: LocalDoc/azerbaijan_legislation
Contact
vrashad — v.resad.89@gmail.com
