zjlergf/biomed-qa-20k-with-context
Biomedical QA 20k (with context) 生物医学 / 生命科学问答评测集,共 20,834 条。每条样本都附带回答所依据的原文段落(context),可直接用于检索 / 记忆增强等评测设置。全部样本可自动评测,字段遵循统一的 25 键 JSON schema。 1. 总览 项 值 总条数 20,834(train 17,500 / dev 1,752 / test 1,582) 来源数据集 3 个(PubMedQA / BioMRC / COVID-QA) 题型 yes_no_maybe 9,493 + single_choice 9,600 + short_answer 1,741 原文 context 非空率 20,834 / 20,834 = 100% 平均 Qwen3 token/条 1078.88(train 1098.57 / dev 1082.99 / test 856.54;中位 450,p90 764,max 16882)… See the full description on the dataset page: https://huggingface.co/datasets/zjlergf/biomed-qa-20k-with-context.
Biomedical QA 20k (with context)
生物医学 / 生命科学问答评测集,共 20,834 条。每条样本都附带回答所依据的原文段落(context),可直接用于检索 / 记忆增强等评测设置。全部样本可自动评测,字段遵循统一的 25 键 JSON schema。
1. 总览
2. 来源清单
许可为逐源:PubMedQA = MIT,BioMRC = CC-BY-4.0,COVID-QA = Apache-2.0。分布:MIT 9,493 / CC-BY-4.0 9,600 / Apache-2.0 1,741。
3. 每条自带原文 context
三个源的每条样本都附带一段生物医学原文(PubMed 摘要或 CORD-19 论文段落),问题必须依据该原文作答:
- PubMedQA:context = PubMed 摘要背景段,判断 yes / no / maybe。
- BioMRC:context = PubMed 摘要(实体匿名为
@entityN),从候选实体中填补标题空缺。 - COVID-QA:context = CORD-19 论文段落,答案为文中精确文本片段。
context 非空率 100%;COVID-QA 的 answer 均为 context 的精确子串(可做严格 EM 判分)。
4. train / dev / test 划分
test 为干净 held-out:与 train / dev 无样本、无题干、无同一原文的重叠。
- BioMRC 的 test 取官方 test 划分;PubMedQA 按 pubid 稳定哈希切分(同 PMID 不跨集);COVID-QA 按 document_id 稳定哈希切分(同一论文不跨集)。
- 三集两两规范化题干哈希交集 = 0,精确全内容跨集重复 = 0,同一 source_id 不跨集。
5. 字段(统一 25 键 schema)
每行一个 JSON 对象:
subdomain 分布:clinicalresearch 11,234 / clinicalmedicine 5,911 / basicmedicalscience 2,364 / pharmacology 1,325。
答案分布:PubMedQA yes/no/maybe ≈ 50/48/1;BioMRC 与 COVID-QA 无单一答案占比 ≥ 0.7。
6. 平均 token 数
- tokenizer:Qwen/Qwen3-8B 的
tokenizer.json(BPE,vocab 151,643)。 - 口径:question + instruction + context + choices 拼接后编码,不含 answer / gold_rationale。
- 全量平均 1078.88 tokens/条;按源 PubMedQA 374.63 / BioMRC 516.82 / COVID-QA 8018.15。明细见
token_stats.json。
7. 文件
biomedical_full.jsonl— 全部 20,834 条biomedical_full.train.jsonl/biomedical_full.dev.jsonl/biomedical_full.test.jsonl— 各划分biomedical_card.md— 本数据卡source_info.csv— 逐源来源 / 链接 / 许可split_manifest.json— 划分计数与隔离统计token_stats.json— Qwen3 token 统计biomed_qa_20k.zip— 以上文件打包
8. 加载
from datasets import load_dataset
ds = load_dataset("zjlergf/biomed-qa-20k-with-context",
data_files="biomedical_full.train.jsonl")下载地址:https://huggingface.co/datasets/zjlergf/biomed-qa-20k-with-context
