bbasavar/squad-v2-closed-corpus-v1
SQuAD 2.0 Closed Wikipedia Corpus v1 Full plaintext for 452 Wikipedia articles drawn from the SQuAD 2.0 source corpus (477 unique articles total; 25 dev articles held back for grading). Dataset configs Config File Use default train.parquet Dataset Viewer — title, pageid, text length, 1000-char preview full corpus_v1.parquet Full article text via load_dataset(..., name="full") — corpus_v1.jsonl Pinned release file for offset validation (download… See the full description on the dataset page: https://huggingface.co/datasets/bbasavar/squad-v2-closed-corpus-v1.
SQuAD 2.0 Closed Wikipedia Corpus v1
Full plaintext for 452 Wikipedia articles drawn from the SQuAD 2.0 source corpus (477 unique articles total; 25 dev articles held back for grading).
Dataset configs
The viewer uses default because full Wikipedia articles (up to ~190k chars each) exceed Hugging Face's preview size limit.
Checksum (JSONL)
SHA256: 35c4f9c0a19796654b9db99a280bf7c287895bb8879f7e4715ba75cc2a0ed3b7Load
Browse in viewer: open the Dataset Viewer tab (uses default config).
Full text for RAG / validation:
from datasets import load_dataset
ds = load_dataset("bbasavar/squad-v2-closed-corpus-v1", name="full", split="train")
print(ds[0]["title"], len(ds[0]["text"]))Download pinned JSONL:
from huggingface_hub import hf_hub_download
path = hf_hub_download(
repo_id="bbasavar/squad-v2-closed-corpus-v1",
filename="corpus_v1.jsonl",
repo_type="dataset",
)Source
Built from rajpurkar/squad_v2 article titles, fetched from the English Wikipedia API and frozen as corpus_v1.
