DinoStackAI/narrativeqa-rag
NarrativeQA RAG Dataset for Retrieval-Augmented Generation (RAG) based on NarrativeQA. Structure Subset Splits Description corpus train (default) Wikipedia plot summaries shared across all query splits queries train, dev, test Reading comprehension questions qrels train, dev, test Relevance judgments (query ↔ document) answers train, dev, test Reference answers (longest annotated answer) Dataset statistics Split Queries… See the full description on the dataset page: https://huggingface.co/datasets/DinoStackAI/narrativeqa-rag.
NarrativeQA RAG
Dataset for Retrieval-Augmented Generation (RAG) based on NarrativeQA.
Structure
Dataset statistics
The corpus is shared across all splits and contains Wikipedia plot summaries (document.summary.text) from the original NarrativeQA documents.
- Dev split: mapped from the original
validationsplit - Corpus source: unique documents from train, validation and test splits
Source
Schema
corpus
{"id": "...", "title": "...", "text": "..."}queries
{"id": "...", "text": "..."}qrels
{"query_id": "...", "corpus_id": "...", "score": 1}answers
{"query_id": "...", "answer": "..."}Usage
from datasets import load_dataset
corpus = load_dataset("DinoStackAI/narrativeqa-rag", "corpus")["train"]
queries = load_dataset("DinoStackAI/narrativeqa-rag", "queries")
qrels = load_dataset("DinoStackAI/narrativeqa-rag", "qrels")
answers = load_dataset("DinoStackAI/narrativeqa-rag", "answers")
train_queries = queries["train"]
dev_qrels = qrels["dev"]
test_answers = answers["test"]Citation
NarrativeQA is released under the Apache 2.0 License.
@article{kocisky-etal-2018-narrativeqa,
title = "The {N}arrative{QA} Reading Comprehension Challenge",
author = "Ko{\v{c}}isk{\'y}, Tom{\'a}{\v{s}} and
Schwarz, Jonathan and
Blunsom, Phil and
Dyer, Chris and
Hermann, Karl Moritz and
Melis, G{\'a}bor and
Grefenstette, Edward",
journal = "Transactions of the Association for Computational Linguistics",
volume = "6",
year = "2018",
pages = "317--328",
}