SallySims/equibert-similarity
EquiBERT — Semantic Similarity
Model ID: SallySims/equibert-similarity
Siamese encoder that produces 768-dimensional sentence embeddings optimised for DEI text similarity. Trained with Multiple Negatives Ranking (MNR) loss.
Usage
from transformers import AutoTokenizer
import torch
import torch.nn.functional as F
tokenizer = AutoTokenizer.from_pretrained("SallySims/equibert-similarity")
texts = [
"We need a rock star developer who can dominate the roadmap.",
"Looking for a ninja engineer to crush our technical goals.",
]
enc = tokenizer(texts, padding=True, truncation=True,
max_length=128, return_tensors="pt")
# embeddings = model.encode(enc["input_ids"], enc["attention_mask"])
# similarity = F.cosine_similarity(embeddings[0], embeddings[1], dim=0)Applications
- Duplicate DEI policy detection
- Semantically similar bias pattern clustering
- DEI document deduplication
- Similar microaggression grouping
Model Description
EquiBERT is a multi-task DEI (Diversity, Equity and Inclusion) transformer built on a dual-encoder backbone that fuses RoBERTa-base and DeBERTa-v3-base via a learned weighted sum (α parameter). The fused representation is fed into task-specific heads covering 17 distinct DEI analysis tasks.
Organisation: SallySims Framework: PyTorch + HuggingFace Transformers Backbone: RoBERTa-base + DeBERTa-v3-base (dual encoder, fused) Language: English Domain: Organisational DEI text — HR communications, policies, job descriptions, performance reviews, leadership statements, reports
Architecture
Input Text
│
├──▶ RoBERTa-base encoder ──▶ Linear projection
│ │
└──▶ DeBERTa-v3-base encoder ──▶ Linear projection
│
Weighted fusion (learned α)
│
Layer Norm + Dropout
│
Task-specific head (see below)Training Data
Trained on synthetic DEI organisational text generated by the EquiBERT synthetic data pipeline, covering 20 DEI categories across HR, policy, leadership, and workforce analytics domains. For production use, fine-tune on real labelled DEI data.
Limitations
- Trained on synthetic data — predictions should be validated before use in real HR or policy decisions.
- English-only.
- Not a substitute for qualified DEI practitioners or legal advice.
- May reflect biases present in the training corpus.
Citation
If you use EquiBERT in your research, please cite:
@misc{equibert2024,
author = {SallySims},
title = {EquiBERT: A Multi-Task DEI Transformer},
year = {2024},
publisher = {HuggingFace},
url = {https://huggingface.co/SallySims}
}