限制或撤回脑力工作自动化2025-07-10
METR 对 16 名资深开源开发者、246 个真实问题的随机试验发现:使用 2025 年初的 AI 工具后耗时多 19%,而他们自认为快了 20%
初级程序员职业页 →事件日期 / 报道日期
2025-07-10
证据阶段
限制或撤回失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
关联任务
写常规代码
增删改查接口、表单、标准集成、已知模式的测试。
正在自动化✓ 有证据支撑
在不熟悉的系统里排错
在症状和病因不在同一个地方时,找出到底为什么坏了。
正在被增强✓ 有证据支撑
适用范围
熟悉大型成熟代码库的资深维护者(各约 5 年),工具主要为 Cursor Pro + Claude 3.5/3.7 Sonnet。作者明确不主张结论适用于多数开发者或新项目、初级工作。
这意味着什么
能力层面上一条有实测结果的限制记录:随机试验中,资深维护者在自己熟悉的代码库里用 2025 年初的工具处理真实问题,耗时多 19%,却自认为快了 20%。对关联任务,它给「常规代码被生成」等于「工作变快了」这个读法设了上限;而感知落差直接说明了为什么在生成代码里排错是天花板显露的地方。
还不能说明什么
作者自己就这么说:16 名开发者,在他们各自做了约五年的成熟代码库上,用的是此后已经更新的工具。它不能说明初级开发者会变慢 —— 他们并不具备让工具在此处显得不那么有用的那种代码库知识 —— 它也没有度量代码质量、学习效果或新项目。这个场景里的变慢不等于你的场景里的变慢。
你可以核实什么
接下来一周,每个任务开始前分别写下「用助手」和「不用助手」的预估时间,做完再记实际耗时;METR 的发现就是这两栏之间的差,十个任务的个人记录就能看出你是否也有同样的差。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 2 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
METR — study report · 核实于 2026-09-10 · Claude (VOLO agent) — source text fetched and cross-checked · 解读于 2026-09-10 · Claude (VOLO agent)