CoolFace
Modelpublic

JAYADIR/mdts-circuit-full-bm25

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes9downloads
Model Card

mdts-circuit-full-bm25

Circuit-Full fine-tuned cross-encoder with BM25 hard negatives. Attention + MLP in IE-ranked layers 8-11 (4.73M params). Strategy D from MDTS circuit fine-tuning experiments on SciFact. Best efficiency score (0.0057 NDCG per million params).

Base Model

cross-encoder/ms-marco-MiniLM-L-12-v2

Training Data

SciFact (BEIR benchmark) with BM25 hard negatives.

Results on SciFact (NDCG@10)

StrategyParamsNDCG@10Delta
A: Circuit MLP-only2.36M0.6545+0.0110
B: Last-4 Layers7.10M0.6686+0.0251
C: Full Fine-Tuning33.36M0.6879+0.0444
D: Circuit-Full (BM25)4.73M0.6707+0.0272
E: Circuit-Full (Mixed)4.73M0.6622+0.0187

Usage

python
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

tokenizer = AutoTokenizer.from_pretrained("JAYADIR/mdts-circuit-full-bm25")
model = AutoModelForSequenceClassification.from_pretrained("JAYADIR/mdts-circuit-full-bm25")

query = "What fertilizer is best for wheat?"
passage = "Wheat requires nitrogen-rich fertilizer during early growth stages."

inputs = tokenizer(query, passage, return_tensors="pt", truncation=True, max_length=512)
with torch.no_grad():
    score = model(**inputs).logits.squeeze().item()
print(f"Relevance score: {score:.4f}")