CoolFace
Datasetpublic

BeIR/cqadupstack

Dataset Card for BEIR Benchmark Dataset Summary BEIR is a heterogeneous benchmark built from 18 diverse datasets representing 9 information retrieval tasks. Fact-checking: FEVER, Climate-FEVER, SciFact Question-Answering: NQ, HotpotQA, FiQA-2018 Bio-Medical IR: TREC-COVID, BioASQ, NFCorpus News Retrieval: TREC-NEWS, Robust04 Argument Retrieval: Touche-2020, ArguAna Duplicate Question Retrieval: Quora, CqaDupstack Citation-Prediction: SCIDOCS Tweet Retrieval:… See the full description on the dataset page: https://huggingface.co/datasets/BeIR/cqadupstack.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes483downloads
Dataset Card

Dataset Card for BEIR Benchmark

Dataset Description

  • —Homepage: https://beir.ai
  • —Repository: https://beir.ai
  • —Paper: https://openreview.net/forum?id=wCu6T5xFjeJ
  • —Leaderboard: https://docs.google.com/spreadsheets/d/1L8aACyPaXrL8iEelJLGqlMqXKPX2oSP_R10pZoy77Ns
  • —Point of Contact: nandan.thakur@uwaterloo.ca

Dataset Summary

BEIR is a heterogeneous benchmark built from 18 diverse datasets representing 9 information retrieval tasks.

This `cqadupstack` subset is the Duplicate Question Retrieval task within BEIR, with 12 domains.

Languages

All tasks are in English (en).

Dataset Structure

This dataset uses the standard BEIR retrieval layout with 12 domain configs: android, english, gaming, gis, mathematica, physics, programmers, stats, tex, unix, webmasters, wordpress.

Each config includes:

  • —corpus: one row per document with _id, title, text
  • —queries: one row per query with _id, title, text

Data Fields

  • —_id (string): unique identifier
  • —title (string): title (empty string when unavailable)
  • —text (string): document/query text

CQADupstack Data Splits

DomainSplitRows
androidcorpus22,998
androidqueries699
englishcorpus40,221
englishqueries1,570
gamingcorpus45,301
gamingqueries1,595
giscorpus37,637
gisqueries885
mathematicacorpus16,705
mathematicaqueries804
physicscorpus38,316
physicsqueries1,039
programmerscorpus32,176
programmersqueries876
statscorpus42,269
statsqueries652
texcorpus68,184
texqueries2,906
unixcorpus47,382
unixqueries1,072
webmasterscorpus17,405
webmastersqueries506
wordpresscorpus48,605
wordpressqueries541

Citation Information

bibtex
@inproceedings{
thakur2021beir,
title={{BEIR}: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models},
author={Nandan Thakur and Nils Reimers and Andreas R{\"u}ckl{\'e} and Abhishek Srivastava and Iryna Gurevych},
booktitle={Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 2)},
year={2021},
url={https://openreview.net/forum?id=wCu6T5xFjeJ}
}