swaraj20/resume_gte_embedding
020
π Dataset
This model was fine-tuned on the Resume Dataset from Kaggle(https://www.kaggle.com/datasets/palaksood97/resume-dataset/discussion/174335), containing resumes categorized by job roles. The data was used to generate similarity pairs and synthetic job descriptions for training. ---
π§ Resume GTE Embedding Model
A domain-specific sentence embedding model fine-tuned on resumes using GTE-base. Built for use in HR systems, resume search engines, talent matching, and AI-driven hiring.
π Model Card
- Base Model:
thenlper/gte-base - Fine-tuned on:
- Self-supervised resume chunks
- Resume pairs with similar job roles (category-based)
- Resume β synthetic job description pairs
- Dataset Size: 4,169+ semantic chunks
- Loss:
CosineSimilarityLoss - Vector Output Size: 768
- Chunking: Semantic section-based splitting (e.g., βWork Experienceβ, βSkillsβ, etc.)
π§ͺ Intended Use Cases
- β Resume similarity search
- β Resume β Job description matching
- β Candidate clustering by skills or experience
- β Career path embeddings / recommendation
π Example Usage (Python)
from sentence_transformers import SentenceTransformer, util
model = SentenceTransformer("swaraj20/resume_gte_embedding")
resume1 = "Experienced software engineer skilled in Python, ML, and cloud deployment."
resume2 = "Looking for a backend developer with Python and AWS experience."
embedding1 = model.encode(resume1, convert_to_tensor=True)
embedding2 = model.encode(resume2, convert_to_tensor=True)
similarity = util.cos_sim(embedding1, embedding2)
print(f"Similarity Score: {similarity.item():.4f}")