CoolFace
Datasetpublic

DinoStackAI/narrativeqa-rag

NarrativeQA RAG Dataset for Retrieval-Augmented Generation (RAG) based on NarrativeQA. Structure Subset Splits Description corpus train (default) Wikipedia plot summaries shared across all query splits queries train, dev, test Reading comprehension questions qrels train, dev, test Relevance judgments (query ↔ document) answers train, dev, test Reference answers (longest annotated answer) Dataset statistics Split Queries… See the full description on the dataset page: https://huggingface.co/datasets/DinoStackAI/narrativeqa-rag.

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes201downloads
Dataset Card

NarrativeQA RAG

Dataset for Retrieval-Augmented Generation (RAG) based on NarrativeQA.

Structure

SubsetSplitsDescription
corpustrain (default)Wikipedia plot summaries shared across all query splits
queriestrain, dev, testReading comprehension questions
qrelstrain, dev, testRelevance judgments (query ↔ document)
answerstrain, dev, testReference answers (longest annotated answer)

Dataset statistics

SplitQueriesCorpus
train327471572
dev34611572
test105571572

The corpus is shared across all splits and contains Wikipedia plot summaries (document.summary.text) from the original NarrativeQA documents.

  • Dev split: mapped from the original validation split
  • Corpus source: unique documents from train, validation and test splits

Source

ComponentNarrativeQA resource
Traintrain split from deepmind/narrativeqa
Devvalidation split
Testtest split
Corpusdocument.summary.text (+ document.summary.title)
AnswersLongest answer text per question

Schema

corpus

json
{"id": "...", "title": "...", "text": "..."}

queries

json
{"id": "...", "text": "..."}

qrels

json
{"query_id": "...", "corpus_id": "...", "score": 1}

answers

json
{"query_id": "...", "answer": "..."}

Usage

python
from datasets import load_dataset

corpus = load_dataset("DinoStackAI/narrativeqa-rag", "corpus")["train"]
queries = load_dataset("DinoStackAI/narrativeqa-rag", "queries")
qrels = load_dataset("DinoStackAI/narrativeqa-rag", "qrels")
answers = load_dataset("DinoStackAI/narrativeqa-rag", "answers")

train_queries = queries["train"]
dev_qrels = qrels["dev"]
test_answers = answers["test"]

Citation

NarrativeQA is released under the Apache 2.0 License.

bibtex
@article{kocisky-etal-2018-narrativeqa,
    title = "The {N}arrative{QA} Reading Comprehension Challenge",
    author = "Ko{\v{c}}isk{\'y}, Tom{\'a}{\v{s}}  and
      Schwarz, Jonathan  and
      Blunsom, Phil  and
      Dyer, Chris  and
      Hermann, Karl Moritz  and
      Melis, G{\'a}bor  and
      Grefenstette, Edward",
    journal = "Transactions of the Association for Computational Linguistics",
    volume = "6",
    year = "2018",
    pages = "317--328",
}