CoolFace
Datasetpublic

irds/antique_train_split200-train

Dataset Card for antique/train/split200-train The antique/train/split200-train dataset, provided by the ir-datasets package. For more information about the dataset, see the documentation. Data This dataset provides: queries (i.e., topics); count=2,226 qrels: (relevance assessments); count=25,229 For docs, use irds/antique Usage from datasets import load_dataset queries = load_dataset('irds/antique_train_split200-train', 'queries') for record… See the full description on the dataset page: https://huggingface.co/datasets/irds/antique_train_split200-train.

sourceHugging Faceupdated 4y agoView on Hugging Face
0likes16downloads
antique_train_split200-train.py44 linesDownload Raw Back to root
1 2"""3""" # TODO4try:5    import ir_datasets6except ImportError as e:7    raise ImportError('ir-datasets package missing; `pip install ir-datasets`')8import datasets9 10IRDS_ID = 'antique/train/split200-train'11IRDS_ENTITY_TYPES = {'queries': {'query_id': 'string', 'text': 'string'}, 'qrels': {'query_id': 'string', 'doc_id': 'string', 'relevance': 'int64'}}12 13_CITATION = '@inproceedings{Hashemi2020Antique,\n  title={ANTIQUE: A Non-Factoid Question Answering Benchmark},\n  author={Helia Hashemi and Mohammad Aliannejadi and Hamed Zamani and Bruce Croft},\n  booktitle={ECIR},\n  year={2020}\n}'14 15_DESCRIPTION = "" # TODO16 17class antique_train_split200_train(datasets.GeneratorBasedBuilder):18    BUILDER_CONFIGS = [datasets.BuilderConfig(name=e) for e in IRDS_ENTITY_TYPES]19 20    def _info(self):21        return datasets.DatasetInfo(22            description=_DESCRIPTION,23            features=datasets.Features({k: datasets.Value(v) for k, v in IRDS_ENTITY_TYPES[self.config.name].items()}),24            homepage=f"https://ir-datasets.com/antique#antique/train/split200-train",25            citation=_CITATION,26        )27 28    def _split_generators(self, dl_manager):29        return [datasets.SplitGenerator(name=self.config.name)]30 31    def _generate_examples(self):32        dataset = ir_datasets.load(IRDS_ID)33        for i, item in enumerate(getattr(dataset, self.config.name)):34            key = i35            if self.config.name == 'docs':36                key = item.doc_id37            elif self.config.name == 'queries':38                key = item.query_id39            yield key, item._asdict()40 41    def as_dataset(self, split=None, *args, **kwargs):42        split = self.config.name # always return split corresponding with this config to avid returning a redundant DatasetDict layer43        return super().as_dataset(split, *args, **kwargs)44