CoolFace
Datasetpublic

bbasavar/squad-v2-closed-corpus-v1

SQuAD 2.0 Closed Wikipedia Corpus v1 Full plaintext for 452 Wikipedia articles drawn from the SQuAD 2.0 source corpus (477 unique articles total; 25 dev articles held back for grading). Dataset configs Config File Use default train.parquet Dataset Viewer — title, pageid, text length, 1000-char preview full corpus_v1.parquet Full article text via load_dataset(..., name="full") — corpus_v1.jsonl Pinned release file for offset validation (download… See the full description on the dataset page: https://huggingface.co/datasets/bbasavar/squad-v2-closed-corpus-v1.

sourceHugging Facecc-by-sa-4.0updated 24d agoView on Hugging Face
0likes62downloads
Dataset Card

SQuAD 2.0 Closed Wikipedia Corpus v1

Full plaintext for 452 Wikipedia articles drawn from the SQuAD 2.0 source corpus (477 unique articles total; 25 dev articles held back for grading).

Dataset configs

ConfigFileUse
defaulttrain.parquetDataset Viewer — title, pageid, text length, 1000-char preview
fullcorpus_v1.parquetFull article text via load_dataset(..., name="full")
—corpus_v1.jsonlPinned release file for offset validation (download directly)

The viewer uses default because full Wikipedia articles (up to ~190k chars each) exceed Hugging Face's preview size limit.

Checksum (JSONL)

SHA256: 35c4f9c0a19796654b9db99a280bf7c287895bb8879f7e4715ba75cc2a0ed3b7

Load

Browse in viewer: open the Dataset Viewer tab (uses default config).

Full text for RAG / validation:

python
from datasets import load_dataset

ds = load_dataset("bbasavar/squad-v2-closed-corpus-v1", name="full", split="train")
print(ds[0]["title"], len(ds[0]["text"]))

Download pinned JSONL:

python
from huggingface_hub import hf_hub_download

path = hf_hub_download(
    repo_id="bbasavar/squad-v2-closed-corpus-v1",
    filename="corpus_v1.jsonl",
    repo_type="dataset",
)

Source

Built from rajpurkar/squad_v2 article titles, fetched from the English Wikipedia API and frozen as corpus_v1.