使用者采用脑力工作自动化2024-03-11
斯坦福的一项研究估计,在几个 AI 会议的同行评审中,有 6.5% 到 16.9% 的文字可能被语言模型实质改写
大学教师职业页 →事件日期 / 报道日期
2024-03-11
证据阶段
使用者采用一件工具在真实工作里被大规模使用,并且被测量到 —— 而做出「用它」这个决定的是使用者本人,不是雇主。它比「技术能力」多:干的是真活,不是演示;又比「实际部署」少:没有任何雇主把它投入生产、要求使用、或围绕它改过流程。权重定为 `cautious`:`automating` 的定义是「机器能做这件事**并且**有采用迹象」,而这就是一种采用迹象 —— 但使用可能只是试用,而且相当一部分测量来自有利害关系的一方,所以一条永远不够,两条独立的才够。还要注意是谁在计数。厂商遥测直接看得见这件事,而它同时在卖这件工具,所以这类记录要在适用范围里写明这层利害;而一个统计机构去问企业「员工有没有在任务里用 AI」,看见的是同一条通道、却没有任何利害 —— 在它存在的地方,它是更好的来源。
关联任务
同行评审
评审其他研究者的论文和申请。
仍由人主导✓ 有证据支撑
适用范围
AI 会议(ICLR、NeurIPS、CoRL、EMNLP)的同行评审。研究用一种总体层面的估计方法报告:提交给这些会议的评审文字中,有 6.5% 到 16.9% 可能被大语言模型实质改写,超出拼写检查或小幅润色。它只覆盖 AI 会议,估计的是文字比例,不是具体审稿人。
这意味着什么
审稿人已经在用语言模型处理评审,至少在 AI 研究领域如此。随之而来的规则,讲的是他们可以交出去什么、又必须自己判断什么。
还不能说明什么
只限 AI 会议;估计的是文字比例,不是评审质量或判断怎样变化。
你可以核实什么
打开 arXiv 2403.07183,在摘要中找到 "between 6.5% and 16.9%"。
是否改变评估
否。影响指数不会被单条事件改变;而且「使用者采用」这一档单条本来就不改变层级 —— 它算进判断所需的条数,但要再有一条独立记录,这项判断才算「有证据支撑」。本条已计入;单独它什么也没改变。
来源
Liang, Izzo, Zhang et al. (Stanford University) — Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews, arXiv 2403.07183 (submitted 11 Mar 2024; ICML 2024) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。