sentence-transformers/quora-duplicates-mining
Dataset Card for Quora Duplicate Questions This dataset contains the Quora Question Pairs dataset in a format that is easily used with the ParaphraseMiningEvaluator evaluator in Sentence Transformers. The data was originally created by Quora for this Kaggle Competition. Usage from datasets import load_dataset from sentence_transformers.SentenceTransformer import SentenceTransformer from sentence_transformers.evaluation import ParaphraseMiningEvaluator # Load the… See the full description on the dataset page: https://huggingface.co/datasets/sentence-transformers/quora-duplicates-mining.
Dataset Card for Quora Duplicate Questions
This dataset contains the Quora Question Pairs dataset in a format that is easily used with the `ParaphraseMiningEvaluator` evaluator in Sentence Transformers. The data was originally created by Quora for this Kaggle Competition.
Usage
from datasets import load_dataset
from sentence_transformers.SentenceTransformer import SentenceTransformer
from sentence_transformers.evaluation import ParaphraseMiningEvaluator
# Load the Quora Duplicates Mining dataset
questions_dataset = load_dataset("sentence-transformers/quora-duplicates-mining", "questions", split="dev")
duplicates_dataset = load_dataset("sentence-transformers/quora-duplicates-mining", "duplicates", split="dev")
# Create a mapping from qid to question & a list of duplicates (qid1, qid2)
qid_to_questions = dict(zip(questions_dataset["qid"], questions_dataset["question"]))
duplicates = list(zip(duplicates_dataset["qid1"], duplicates_dataset["qid2"]))
# Initialize the paraphrase mining evaluator
paraphrase_mining_evaluator = ParaphraseMiningEvaluator(qid_to_questions, duplicates, name="quora-duplicates-dev")
# Load a model to evaluate
model = SentenceTransformer("all-MiniLM-L6-v2")
results = paraphrase_mining_evaluator(model)
print(results){
'quora-duplicates-dev_average_precision': 0.5537837023752262,
'quora-duplicates-dev_f1': 0.542585123346778,
'quora-duplicates-dev_precision': 0.5112918195076678,
'quora-duplicates-dev_recall': 0.5779587350751861,
'quora-duplicates-dev_threshold': 0.8290803134441376,
}Dataset Subsets
questions subset
- Columns: "question", "qid"
- Column types:
str,str - Examples:
{
'question': 'How do I prepare for TCS IT Wiz?',
'qid': '107646',
}- Collection strategy: A direct copy of the
quora-IR-dataset/duplicate-miningas generated from `create_splits.py`. - Deduplified: No
duplicates subset
- Columns: "qid1", "qid2"
- Column types:
str,str - Examples:
{
'qid1': '43345',
'qid2': '43346',
}- Collection strategy: A direct copy of the
quora-IR-dataset/duplicate-miningas generated from `create_splits.py`. - Deduplified: No
