chengwanru/auto-research-bench-data
auto-research-bench-data 同行评审语料 + 论文 PDF,覆盖五个机器学习会议 2022–2026 年。 用于研究「AI 生成的论文与人类论文有何差异」,特别是图表质量与实验管理两个维度。 数据来自 OpenReview,用官方 API 抓取。 内容 1. 评审元数据(18 个 jsonl,3.11 GB) 每行一篇投稿,字段如下: 字段 说明 forum OpenReview 论文 ID,与 PDF 文件名一致,是关联两部分数据的 key title / abstract / keywords 论文元信息 venue / venueid 录用层级。注意层级只在 venue 里(如 ICLR 2024 oral),venueid 对所有录用论文都是 .../Conference reviews 全部 Official_Review,含评分、置信度、正文各字段 comments 作者 rebuttal 与其他… See the full description on the dataset page: https://huggingface.co/datasets/chengwanru/auto-research-bench-data.
auto-research-bench-data
同行评审语料 + 论文 PDF,覆盖五个机器学习会议 2022–2026 年。 用于研究「AI 生成的论文与人类论文有何差异」,特别是图表质量与实验管理两个维度。
数据来自 OpenReview,用官方 API 抓取。
内容
1. 评审元数据(18 个 jsonl,3.11 GB)
每行一篇投稿,字段如下:
共 73,566 篇投稿、267,117 条评审、711,880 条评论。
2. 论文 PDF(13 个 tar,44.9 GB,8,416 篇)
按 pdf/{会议}_{年份}.tar 组织,解包后是 {会议}_{年份}/{forum}.pdf。
只包含用于本研究的子集:全部 oral + spotlight 论文,加上按 1:2 抽样的被拒论文。 不是全量投稿。
怎么用
from datasets import load_dataset
# 只取需要的年份,不必下载全部
ds = load_dataset("chengwanru/auto-research-bench-data", data_files="ICLR_2024.jsonl")# 关联 PDF 与评审
import tarfile, json
from huggingface_hub import hf_hub_download
p = hf_hub_download("chengwanru/auto-research-bench-data",
"pdf/ICLR_2024.tar", repo_type="dataset")
with tarfile.open(p) as tf:
pdf = tf.extractfile("ICLR_2024/<forum_id>.pdf").read()各会议实际覆盖内容差异很大
会议的公开政策不同,不是抓取遗漏:
被拒论文实际只有 ICLR 有规模。 NeurIPS 三年合计只有 631 篇公开被拒, ICML 2023/2024 一篇都没有。这限制了任何需要负样本的分析。
评分字段名随年份变化:2022–2023 用 recommendation,2024 起用 rating; 2024 及以前取值是 "5: marginally below..." 这样的字符串,2025 起是纯数字。
已知缺口
选中 8,865 篇,实际上传 8,416 篇,完整率 94.9%,缺 449 篇。
缺口来自 OpenReview 下载失败,原因是并发拉取大文件超时(ACM MM 单篇可达 50 MB) 以及持续高频请求触发限流。降到单线程重跑能基本消除:ACM MM 从 38% 失败降到 0, ICLR 2024 从 17% 降到 0.5%。已补跑的四批完整率 94.8%–100%,其余批次 89%–95%。
各批次完整率:
缺失的论文可以用 jsonl 里的 pdf 字段自行从 OpenReview 补取(需账号)。
NeurIPS 2022 没有 oral/spotlight 层级,未纳入 PDF 子集。
许可与使用
评审内容来自 OpenReview 公开页面。论文 PDF 版权归各自作者所有, ICLR 投稿多数采用 CC BY 4.0,其他会议以各自政策为准。
本数据集仅供学术研究使用。 使用论文内容时请引用原论文。 如果你是某篇论文的作者并希望移除,请通过 HuggingFace 联系。
生成方式
抓取与处理脚本见 github.com/chengwanru/auto-research-bench (scripts/fetch_openreview.py、scripts/upload_pdfs_to_hf.py)。
