irds/antique_train_split200-train
Dataset Card for antique/train/split200-train The antique/train/split200-train dataset, provided by the ir-datasets package. For more information about the dataset, see the documentation. Data This dataset provides: queries (i.e., topics); count=2,226 qrels: (relevance assessments); count=25,229 For docs, use irds/antique Usage from datasets import load_dataset queries = load_dataset('irds/antique_train_split200-train', 'queries') for record… See the full description on the dataset page: https://huggingface.co/datasets/irds/antique_train_split200-train.
016
1 2"""3""" # TODO4try:5 import ir_datasets6except ImportError as e:7 raise ImportError('ir-datasets package missing; `pip install ir-datasets`')8import datasets9 10IRDS_ID = 'antique/train/split200-train'11IRDS_ENTITY_TYPES = {'queries': {'query_id': 'string', 'text': 'string'}, 'qrels': {'query_id': 'string', 'doc_id': 'string', 'relevance': 'int64'}}12 13_CITATION = '@inproceedings{Hashemi2020Antique,\n title={ANTIQUE: A Non-Factoid Question Answering Benchmark},\n author={Helia Hashemi and Mohammad Aliannejadi and Hamed Zamani and Bruce Croft},\n booktitle={ECIR},\n year={2020}\n}'14 15_DESCRIPTION = "" # TODO16 17class antique_train_split200_train(datasets.GeneratorBasedBuilder):18 BUILDER_CONFIGS = [datasets.BuilderConfig(name=e) for e in IRDS_ENTITY_TYPES]19 20 def _info(self):21 return datasets.DatasetInfo(22 description=_DESCRIPTION,23 features=datasets.Features({k: datasets.Value(v) for k, v in IRDS_ENTITY_TYPES[self.config.name].items()}),24 homepage=f"https://ir-datasets.com/antique#antique/train/split200-train",25 citation=_CITATION,26 )27 28 def _split_generators(self, dl_manager):29 return [datasets.SplitGenerator(name=self.config.name)]30 31 def _generate_examples(self):32 dataset = ir_datasets.load(IRDS_ID)33 for i, item in enumerate(getattr(dataset, self.config.name)):34 key = i35 if self.config.name == 'docs':36 key = item.doc_id37 elif self.config.name == 'queries':38 key = item.query_id39 yield key, item._asdict()40 41 def as_dataset(self, split=None, *args, **kwargs):42 split = self.config.name # always return split corresponding with this config to avid returning a redundant DatasetDict layer43 return super().as_dataset(split, *args, **kwargs)44 