试点脑力工作自动化2025-04-13
在一项覆盖两万份评审的随机研究中,ICLR 2025 收到 AI 反馈的审稿人有 27% 修改了评审
大学教师职业页 →事件日期 / 报道日期
2025-04-13
证据阶段
试点真实场景里的小规模试验。说明落地条件正在被检验,不代表条件已经成立 —— 所以单独一次试点永远不够,两次互不相干的才够。
关联任务
同行评审
评审其他研究者的论文和申请。
仍由人主导✓ 有证据支撑
适用范围
一个 AI 会议 2025 年的评审流程。在一项随机研究中,一个基于大语言模型的智能体就审稿人的评审给出反馈;论文报告,收到反馈的审稿人中有 27% 修改了评审,超过 12,000 条反馈建议被采纳。作者评估的是自己搭建的系统,且只在一个会议上运行。
这意味着什么
AI 被用来「评审审稿人」—— 指出评审哪里含糊或不公 —— 审稿人据此修改。对论文的判断仍是审稿人的。
还不能说明什么
只是一个会议,而且是系统搭建者自己的评估。
你可以核实什么
打开 arXiv 2504.09737,找到 "27% of reviewers who received feedback updated their reviews"。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
Thakkar, Yuksekgonul, Silberg et al. — Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025, arXiv 2504.09737 (submitted 13 Apr 2025) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。