CoolFace
Datasetpublic

zjlergf/biomed-qa-20k-with-context

Biomedical QA 20k (with context) 生物医学 / 生命科学问答评测集,共 20,834 条。每条样本都附带回答所依据的原文段落(context),可直接用于检索 / 记忆增强等评测设置。全部样本可自动评测,字段遵循统一的 25 键 JSON schema。 1. 总览 项 值 总条数 20,834(train 17,500 / dev 1,752 / test 1,582) 来源数据集 3 个(PubMedQA / BioMRC / COVID-QA) 题型 yes_no_maybe 9,493 + single_choice 9,600 + short_answer 1,741 原文 context 非空率 20,834 / 20,834 = 100% 平均 Qwen3 token/条 1078.88(train 1098.57 / dev 1082.99 / test 856.54;中位 450,p90 764,max 16882)… See the full description on the dataset page: https://huggingface.co/datasets/zjlergf/biomed-qa-20k-with-context.

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
0likes26downloads
Dataset Card

Biomedical QA 20k (with context)

生物医学 / 生命科学问答评测集,共 20,834 条。每条样本都附带回答所依据的原文段落(context),可直接用于检索 / 记忆增强等评测设置。全部样本可自动评测,字段遵循统一的 25 键 JSON schema。


1. 总览

项值
总条数20,834(train 17,500 / dev 1,752 / test 1,582)
来源数据集3 个(PubMedQA / BioMRC / COVID-QA)
题型yesnomaybe 9,493 + singlechoice 9,600 + shortanswer 1,741
原文 context 非空率20,834 / 20,834 = 100%
平均 Qwen3 token/条1078.88(train 1098.57 / dev 1082.99 / test 856.54;中位 450,p90 764,max 16882)
tokenizerQwen/Qwen3-8B 的 tokenizer.json(vocab 151,643)
auto_evaluable20,834 / 20,834 = 100%
语言 / 模态English / text

2. 来源清单

#数据集领域题型原文形式条数平均 token许可链接
1PubMedQAPubMed 文献结论判断yesnomaybecontext = 摘要9,493374.63MIThttps://huggingface.co/datasets/qiaojin/PubMedQA
2BioMRC(small)PubMed 摘要完形阅读single_choicecontext = 摘要(实体匿名 @entityN)9,600516.82CC-BY-4.0https://huggingface.co/datasets/nlpaueb/biomrc
3COVID-QACOVID-19 文献抽取式 QAshort_answercontext = CORD-19 论文段落1,7418018.15Apache-2.0https://github.com/deepset-ai/COVID-QA
合计3 题型100% 带原文20,8341078.88

许可为逐源:PubMedQA = MIT,BioMRC = CC-BY-4.0,COVID-QA = Apache-2.0。分布:MIT 9,493 / CC-BY-4.0 9,600 / Apache-2.0 1,741。


3. 每条自带原文 context

三个源的每条样本都附带一段生物医学原文(PubMed 摘要或 CORD-19 论文段落),问题必须依据该原文作答:

  • —PubMedQA:context = PubMed 摘要背景段,判断 yes / no / maybe。
  • —BioMRC:context = PubMed 摘要(实体匿名为 @entityN),从候选实体中填补标题空缺。
  • —COVID-QA:context = CORD-19 论文段落,答案为文中精确文本片段。

context 非空率 100%;COVID-QA 的 answer 均为 context 的精确子串(可做严格 EM 判分)。


4. train / dev / test 划分

test 为干净 held-out:与 train / dev 无样本、无题干、无同一原文的重叠。

来源traindevtest
PubMedQA8,000793700
BioMRC8,000800800
COVID-QA1,50015982
合计17,5001,7521,582
  • —BioMRC 的 test 取官方 test 划分;PubMedQA 按 pubid 稳定哈希切分(同 PMID 不跨集);COVID-QA 按 document_id 稳定哈希切分(同一论文不跨集)。
  • —三集两两规范化题干哈希交集 = 0,精确全内容跨集重复 = 0,同一 source_id 不跨集。

5. 字段(统一 25 键 schema)

每行一个 JSON 对象:

字段说明
id样本唯一编号
track / domain均为 biomedical
subdomainclinicalresearch / clinicalmedicine / basicmedicalscience / pharmacology
task_typeliteratureqa / readingcomprehension / extractive_qa
abilityevidencebasedreasoning
question问题
instruction作答指令
context回答所依据的原文段落(非空)
choices选项对象;抽取式题为 null
answer标准答案(选项字母 / 文本片段)
answer_text答案文本
answer_typeyesnomaybe / singlechoice / shortanswer
gold_rationale依据说明(如有)
source_dataset / source_id / source_url来源与溯源
license逐源许可
splittrain / dev / test
eval_metricaccuracy / f1
auto_evaluabletrue
modalitytext
imagenull
difficultyunknown
notes备注

subdomain 分布:clinicalresearch 11,234 / clinicalmedicine 5,911 / basicmedicalscience 2,364 / pharmacology 1,325。

答案分布:PubMedQA yes/no/maybe ≈ 50/48/1;BioMRC 与 COVID-QA 无单一答案占比 ≥ 0.7。


6. 平均 token 数

  • —tokenizer:Qwen/Qwen3-8B 的 tokenizer.json(BPE,vocab 151,643)。
  • —口径:question + instruction + context + choices 拼接后编码,不含 answer / gold_rationale。
  • —全量平均 1078.88 tokens/条;按源 PubMedQA 374.63 / BioMRC 516.82 / COVID-QA 8018.15。明细见 token_stats.json。

7. 文件

  • —biomedical_full.jsonl — 全部 20,834 条
  • —biomedical_full.train.jsonl / biomedical_full.dev.jsonl / biomedical_full.test.jsonl — 各划分
  • —biomedical_card.md — 本数据卡
  • —source_info.csv — 逐源来源 / 链接 / 许可
  • —split_manifest.json — 划分计数与隔离统计
  • —token_stats.json — Qwen3 token 统计
  • —biomed_qa_20k.zip — 以上文件打包

8. 加载

python
from datasets import load_dataset

ds = load_dataset("zjlergf/biomed-qa-20k-with-context",
                  data_files="biomedical_full.train.jsonl")

下载地址:https://huggingface.co/datasets/zjlergf/biomed-qa-20k-with-context