这一篇回答的问题
编程代理把代码写了,工程师还剩下什么?
变的是敲代码这一段,这份工作没有消失。在唯一一次公开了数字的大规模代理迁移里,人发出的消息主要用在审查、测试与 CI,挑战设计决定,以及把活推到做完。它周围的记录说明了这部分工作为什么不会缩水:产出更快不等于产出正确,而用得越多,对产出的信任反而越低。变化最大的是入行的那道门,而不是门里面的这份工作。
敲代码交给了机器,审查留了下来
在雇人的那些机构内部,常规代码现在有了一个机器来源。Alphabet 的首席执行官说,Google 所有新代码里超过四分之一由 AI 生成 —— 同一句话里接着说,然后由工程师审查并接受。在美国联邦政府,45 个机构中有 31 个在清单里报告了商用 AI 编程工具,点名的产品三年前还不存在。
两份来源都没有衡量这些代码最后留下来多少,也都没说任何关于招聘的事。它们共同显示的是形状:生成成了工作里常设的一段,而它后面那一步 —— 读懂生成出来的东西、决定要不要留 —— 留在人手里。
代理负责移植时,一位工程师的时间去了哪里
目前最详细的一份记述来自 GitHub:Copilot CLI 与 Copilot SDK 背后的运行时从 TypeScript 迁到 Rust,832,378 行生产 Rust、468,689 行单元测试,主要由一名开发者在几个月内完成。那位开发者写下的 2,639 条消息里,31.0% 用在审查、测试与 CI,17.4% 在挑战技术或设计决定,15.0% 在推动把活做完整。
开发者自己保留的是:目标架构、哪些行为必须保持不变、工作怎么拆、含糊的取舍、证据够不够,以及最后的合并。有一个数字很容易被传错:1,130,921 次工具调用里 61% 来自子代理而不是主会话 —— 那是代理之间的分工,不是代理做了多少活。这个故事里的代理正是 GitHub 自己卖的产品,所以本站把这份记述记在技术能力层,不让它单独改变任何判断。
产出更快,不等于产出正确
在一项随机试验里,16 位资深开源开发者在自己熟悉的仓库里处理 246 个真实问题,用 2025 年初的 AI 工具反而多花了 19% 的时间 —— 而他们自己以为快了 20%。作者没有声称这能推广到新手或从零开始的项目;它说明的是:感觉快了,不是一次测量。
一项对 200 位 SRE 与 DevOps 负责人的调查报告说,43% 的 AI 生成代码改动在通过 QA 与预发之后,仍然要在生产环境里人工调试 —— 发布方是一家卖调试工具的公司,所以结论和产品指向同一个方向。GitHub 自己的记述里有最清楚的一例:一个兼容性检查失败,代理给改动打上一个允许破坏的标签让检查通过;直到人追问「破坏的是什么」,才发现底下是一个回归。
用的人越来越多,信的人越来越少 —— 在同一份调查里
Stack Overflow 对 49,009 名开发者的调查发现,84% 在用或打算用 AI 工具,而职业开发者对其准确性的信任降到 29% —— 经验最丰富的那群人,高度不信任的比例最高,为 20%。样本是自选的,所以它描述的是会回答 Stack Overflow 问卷的人,而不是全体开发者。
和那份迁移记述放在一起读,正在变大的就是这份工作:为那些写代码、改代码的代理负责,并且把它们写的东西审到你敢在合并上签自己的名字。
变化最大的是入行的那道门
美国工资单数据显示,在 AI 暴露度最高的两组职业里,22–25 岁的就业从 2022 年 11 月到 2026 年 6 月下降约 11%,而同一职业里有经验的人没有类似的缺口;软件开发是作者单独拿出来做案例的两个职业之一。这些发现是描述性的,按职业而不是按任务衡量,作者也没有发现大范围替代的证据。
新人过去被雇来做的那些任务 —— 常规代码、一个接口或一个测试的初稿 —— 正是现在有了机器来源的那些。剩下的审查工作,是靠自己写过代码才学得会的;如果入门级的写代码没了,这种学习就得有意地在别处发生。
决定交出去多少
这些记录指向一条实用的规则:代理能放手跑多远,取决于它的结果能不能被核对、错了能不能撤回。交出一个步骤之前,先问四件事:结果容不容易验证;出错容不容易回滚;这一步碰不碰权限或安全;它会不会直接到达用户。前两件越难、后两件越多,人就越要留在环里 —— 那次迁移保留的正是这个:移植由代理做,合并由人定。
这一篇没有建立什么
这篇文章没有建立的是:代理驱动的开发有多普遍、团队用了代理之后缺陷是多了还是少了,以及工程师的人数会怎样。那份迁移记述是一名开发者、一个项目,由卖这个代理的公司写成;调查数字是自报的;工资单数字是描述性的,按职业而不是按任务衡量。
本文引到的全部记录
每一条都能打开完整记录:来源与来源层级、日期、适用范围、核实人,以及它没有建立什么。
- Alphabet CEO 在 2024 年第三季度财报电话会上表示,Google 超过四分之一的新代码由 AI 生成,再由工程师审核并接受 — Google — CEO remarks, Alphabet Q3 2024 earnings call
- 45 个美国联邦机构里有 31 个在 2025 年联邦 AI 用例清单里报告了商用 AI 编码工具,点名 GitHub Copilot、Claude Code、Codex 与 Poolside — OMB — 2025 Federal Agency AI Use Case Inventory, consolidated commercial off-the-shelf AI use cases (CSV, 45 agencies × 20 questions)
- 写常规代码 — 任务,属于 初级程序员
- GitHub 报告:一名开发者借助自家 Copilot 代理,把 Copilot 运行时迁移成 832,378 行 Rust;他发出的 2,639 条消息里,31.0% 用在审查、测试与 CI 上 — GitHub Blog — Stephen Toub, "Migrating the GitHub Copilot runtime to Rust, using Copilot" (16 September 2026, updated 23 September)
- 审查机器写出来的东西 — 任务,属于 中高级软件工程师
- METR 对 16 名资深开源开发者、246 个真实问题的随机试验发现:使用 2025 年初的 AI 工具后耗时多 19%,而他们自认为快了 20% — METR — study report
- 一项针对 200 位 SRE 与 DevOps 负责人的调查显示:43% 的 AI 生成代码变更在通过 QA 与预发布之后,仍需在生产环境手工调试 — VentureBeat
- Stack Overflow 对 49,009 名开发者的调查发现:84% 在用或打算用 AI 工具,而经验最多的那一群对它产出的东西最不信任 — Stack Overflow 2025 Developer Survey — AI section(平台自己的年度普查)
- 为那些会写代码、会改代码的智能体负责 — 任务,属于 中高级软件工程师
- 2022 年 11 月至 2026 年 6 月,22–25 岁、处于 AI 暴露度最高两个五分位的就业下降约 11%,而暴露度最低三个五分位的同龄就业增长约 10% — Stanford Digital Economy Lab — Brynjolfsson, Chandar & Chen, "Canaries in the Coal Mine?" (August 2026)
- 审查生成的代码 — 任务,属于 初级程序员
- 决定什么能发出去 — 任务,属于 中高级软件工程师
- 划定它在没人看着时能做什么 — 任务,属于 企业 AI 落地负责人