CoolFace
Datasetpublic

chengwanru/auto-research-bench-data

auto-research-bench-data 同行评审语料 + 论文 PDF,覆盖五个机器学习会议 2022–2026 年。 用于研究「AI 生成的论文与人类论文有何差异」,特别是图表质量与实验管理两个维度。 数据来自 OpenReview,用官方 API 抓取。 内容 1. 评审元数据(18 个 jsonl,3.11 GB) 每行一篇投稿,字段如下: 字段 说明 forum OpenReview 论文 ID,与 PDF 文件名一致,是关联两部分数据的 key title / abstract / keywords 论文元信息 venue / venueid 录用层级。注意层级只在 venue 里(如 ICLR 2024 oral),venueid 对所有录用论文都是 .../Conference reviews 全部 Official_Review,含评分、置信度、正文各字段 comments 作者 rebuttal 与其他… See the full description on the dataset page: https://huggingface.co/datasets/chengwanru/auto-research-bench-data.

sourceHugging Faceotherupdated 23d agoView on Hugging Face
0likes256downloads
Dataset Card

auto-research-bench-data

同行评审语料 + 论文 PDF,覆盖五个机器学习会议 2022–2026 年。 用于研究「AI 生成的论文与人类论文有何差异」,特别是图表质量与实验管理两个维度。

数据来自 OpenReview,用官方 API 抓取。

内容

1. 评审元数据(18 个 jsonl,3.11 GB)

每行一篇投稿,字段如下:

字段说明
forumOpenReview 论文 ID,与 PDF 文件名一致,是关联两部分数据的 key
title / abstract / keywords论文元信息
venue / venueid录用层级。注意层级只在 venue 里(如 ICLR 2024 oral),venueid 对所有录用论文都是 .../Conference
reviews全部 Official_Review,含评分、置信度、正文各字段
comments作者 rebuttal 与其他 Official_Comment
decisionsDecision / Meta_Review
pdfOpenReview 上的相对路径

共 73,566 篇投稿、267,117 条评审、711,880 条评论。

2. 论文 PDF(13 个 tar,44.9 GB,8,416 篇)

pdf/{会议}_{年份}.tar 组织,解包后是 {会议}_{年份}/{forum}.pdf

只包含用于本研究的子集:全部 oral + spotlight 论文,加上按 1:2 抽样的被拒论文。 不是全量投稿。

怎么用

python
from datasets import load_dataset

# 只取需要的年份,不必下载全部
ds = load_dataset("chengwanru/auto-research-bench-data", data_files="ICLR_2024.jsonl")
python
# 关联 PDF 与评审
import tarfile, json
from huggingface_hub import hf_hub_download

p = hf_hub_download("chengwanru/auto-research-bench-data",
                    "pdf/ICLR_2024.tar", repo_type="dataset")
with tarfile.open(p) as tf:
    pdf = tf.extractfile("ICLR_2024/<forum_id>.pdf").read()

各会议实际覆盖内容差异很大

会议的公开政策不同,不是抓取遗漏:

语料PDF评审评分rebuttaldecision
ICLR 2022–202688%
NeurIPS 2023–202599%
ICML 2025
ICML 2023–2024
ACM MM 2024
CoRL 2025

被拒论文实际只有 ICLR 有规模。 NeurIPS 三年合计只有 631 篇公开被拒, ICML 2023/2024 一篇都没有。这限制了任何需要负样本的分析。

评分字段名随年份变化:2022–2023 用 recommendation,2024 起用 rating; 2024 及以前取值是 "5: marginally below..." 这样的字符串,2025 起是纯数字。

已知缺口

选中 8,865 篇,实际上传 8,416 篇,完整率 94.9%,缺 449 篇。

缺口来自 OpenReview 下载失败,原因是并发拉取大文件超时(ACM MM 单篇可达 50 MB) 以及持续高频请求触发限流。降到单线程重跑能基本消除:ACM MM 从 38% 失败降到 0, ICLR 2024 从 17% 降到 0.5%。已补跑的四批完整率 94.8%–100%,其余批次 89%–95%。

各批次完整率:

语料选中已传完整率
ACMMM_2024174174100%
CoRL_20254242100%
ICLR_20241359135299.5%
ICLR_202269067998.4%
NeurIPS_202458857698.0%
ICLR_20231113107096.1%
NeurIPS_2025101896895.1%
ICML_202315514794.8%
NeurIPS_202362158093.4%
ICLR_202667262192.4%
ICML_202531929291.5%
ICLR_20251779161790.9%
ICML_202433529889.0%

缺失的论文可以用 jsonl 里的 pdf 字段自行从 OpenReview 补取(需账号)。

NeurIPS 2022 没有 oral/spotlight 层级,未纳入 PDF 子集。

许可与使用

评审内容来自 OpenReview 公开页面。论文 PDF 版权归各自作者所有, ICLR 投稿多数采用 CC BY 4.0,其他会议以各自政策为准。

本数据集仅供学术研究使用。 使用论文内容时请引用原论文。 如果你是某篇论文的作者并希望移除,请通过 HuggingFace 联系。

生成方式

抓取与处理脚本见 github.com/chengwanru/auto-research-benchscripts/fetch_openreview.pyscripts/upload_pdfs_to_hf.py)。