中高级软件工程师
去改自己没写过的系统、决定什么能发出去、并为它怎么坏负责 —— 软件工作里主要是「对某一个具体代码库的判断」而不是打字的那一部分。
这不是失业概率。它把「岗位任务中有多少暴露于自动化」与「采用实际走到了哪一步」合成为一个值 —— 只用于在同一套口径下横向比较职业,除此之外不作他用。
适用于在一个持续维护的生产代码库里做了几年的工程师 —— 做评审、做设计、决定什么能发的那批人。这一页按资历切;前端、后端与数据工程按「你负责哪一层」切,各有自己的页面 —— 所以一个资深前端会同时落在两页上,而它们问的是不同的问题。入门岗单独评估;专职测试另有一页。机器学习工程与稳定性工程是真实存在且确实不同的两份工作,本站还没有覆盖 —— 那是一个缺口,不是「它们属于这一页」的判断。
到底什么在变#
分析单位是任务,不是职位名称。职业不会被整体替代 —— 变的是它的任务构成。
去改一个不是你写的系统
仍由人主导✓ 有证据支撑在一个庞大、活了很久的代码库里做一次改动 —— 那里的约束没有写下来,而是长在此前那些决定已经承诺过的东西里。
这一页上分量最重的证据讲的正是这项任务,而它指向的方向出人意料:在一次针对真实问题、且仓库由参与者自己维护的随机试验里,资深开发者使用 2025 年前后的 AI 工具后耗时多了 19%,而他们自认为快了 20%。一次改动需要的上下文,长在一个人对这个具体系统的心智模型里,而把它喂给工具的成本比省下来的多。
一次试验、16 名开发者、他们自己熟悉的成熟仓库 —— 作者明确说过它不描述大多数开发者、也不描述新项目。它没有说同样的工具一年之后表现如何,而一次测到的「变慢」不是工具的永久属性。
审查机器写出来的东西
新出现的任务≈ 平台推断读一段不是你写的、你也不在场的代码,判断它对不对 —— 而随着生成变便宜,这件事的量在涨。
生成把瓶颈挪了位置,而不是取消它:更多代码进来,而读它的工作落到对这条分支负责的那个人身上。Alphabet 说过,Google 超过四分之一的新代码由 AI 生成、再由工程师审核并接受 —— 那是一句关于「工作挪到了哪里」的描述,不是关于工作消失的描述。
「有多大比例的代码是生成的」不说明审查花了多久、做得好不好,也不说明工程师总数变了没有。审查量上升本身也不等于好工作 —— 它恰恰是在赶时间时最容易做砸的那一部分。
按「它会怎么坏」来设计
仍由人主导≈ 平台推断选一种结构,并选择接受哪些失效模式 —— 知道凌晨三点某个依赖挂掉、而一半请求已经在路上时,会发生什么。
模型可以提出一种架构,并且论证得很流畅。它做不到的是承担这个取舍的后果 —— 而这里的取舍不是技术偏好,是「这家组织扛得住哪一种故障」的赌注,取决于关于这家组织的事实,而不是关于代码的事实。
这是一条关于工作内容的判断,不是一次测量:我们没有任何关于「设计决策被自动化或被抵住」的记录,而这里证据的缺席是最普通的那一种 —— 没有人会把自己的架构评审发出来。
决定什么能发出去
仍由人主导≈ 平台推断成为那个说「这个现在可以发,带着这个已知风险」并在事后为它答复的人。
在这条边界靠测试那一侧的证据是:自动化检查抓得不够。一项针对两百位资深工程师的调查报告称,43% 由 AI 生成的改动在通过 QA 与预发布之后,仍需在生产环境手工调试。无论这个百分比站不站得住 —— 报告的发布方正是一家卖调试工具的公司 —— 这个说法的形状,与那些被独立报道的故障是吻合的。
一份由利益相关方发布的自述式调查,作为「一个数字」是弱证据,作为「一个方向」要强一些。它不能确立「发布决策整体上变难了」,而且它讲的是大型企业软件,不是所有软件。
让另一个人也能做这件事
仍由人主导≈ 平台推断会教人的评审、结对,以及刻意地把上下文交出去 —— 一个团队之所以还能持续有「判断得了」的人,靠的是这套机制。
这项任务正在变成承重墙,而原因在任务之外。2022 年底到 2026 年中,22–25 岁、处于 AI 暴露度最高档的就业下降约 11%,而暴露度低的群体没有;几家砍掉初级岗的组织公开承认,他们把「人如何成长为资深」的那条路一起砍掉了。如果底下进来的人变少,判断力的传递就不再是一个好习惯,而是供应线。
薪资微观数据显示的是就业下降;它没有显示带人这件事变多了,也没有显示有人选择在这件事上投入。「初级进人变少」和「更多教的工作落到资深头上」之间的联系,是对两个事实的解读,不是量出来的。
为那些会写代码、会改代码的智能体负责
新出现的任务≈ 平台推断设定一个自动写代码的智能体在没人看着时能做什么、什么必须先问、它的产出从哪里进入分支 —— 然后成为这个设定后面挂着的那个名字。
这件工作在 2022 年不存在,而且默认没有人被指派去做。凡是允许生成式工具碰到仓库的地方它就会出现,而随之而来的事故通常被归因的不是模型,是「谁被允许合并什么」—— 2026 年 3 月亚马逊的两次故障,被溯因为一次未经批准的 AI 辅助代码改动,随后对 335 个系统做了 90 天的代码安全整顿。
一家公司的故障与整顿不是对整个行业的描述,而一次整顿证明的是「出过事」,不是「这有多普遍」。这里没有任何东西说明这份责任已经是一个有人拿钱去做的岗位。
哪些技术在起作用#
四类独立信号。它们刻意不做加总 —— 一个职业暴露于两种技术,不等于风险翻倍。
它是怎么走到这里的#
指数不是一个静态数字。这是自 ChatGPT 以来,每个能力检查点上它大致会落在哪里 —— 回溯重建,并且如实标注。
● 本职业有 1 条已核实事件,按真实发生日期标在轴上 —— 靠近标记的那几段曲线是有可核对的东西锚定的。
基线比这个站上多数页面都高,因为代码补全与重构工具在 2022 年之前就已经很平常 —— 这个职业是带着「已经被自动化了一部分」的状态进入这段时期的,而且它自己知道。2023 至 2025 的上行,是生成能力走到了「可以起草一整次改动」而不只是「补完一行」。它比初级那条曲线更早、更低地走平,而走平这件事才是有意思的地方:剩下的任务是对某一个具体系统的判断,以及为发出去的东西担责,而更强的模型够不到其中任何一样。这条线和初级那条线之间的落差,要读成问题的形状,不要读成一句安慰 —— 把这条线压住的力量,和把那条线推上去的力量是同一批,而连接它们的正是两者之间那条路。
曲线平缓不是「安全」的预测。它只是在说:到目前为止,自动化触及了哪些任务 —— 这里动得最少的职业,约束都是物理的或监管的,而这两样都会变。
近期变化#
熟悉大型成熟代码库的资深维护者(各约 5 年),工具主要为 Cursor Pro + Claude 3.5/3.7 Sonnet。作者明确不主张结论适用于多数开发者或新项目、初级工作。
失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
这对你意味着什么#
你还不在这一页上,而通往这一页的那条路正是承压的那一段 —— 先去读初级那一页。这里最值得记住的是:这个职业卖的能力是对某一个具体系统的判断力,而它是靠待在那个系统里获得的,不是靠用更好的工具。
这一页上被测出来的结论是:在你自己的代码库上,工具并没有让你更快,而你可能以为它让你快了。把它当成「去量一下自己的工作」的理由,而不是一句安慰:那次试验规模小、而且已经过去一年,而这份工作正在变大的部分不是打字 —— 是审查进来的东西,以及为一个智能体被允许做的事答复。
你的选择#
四个方向,每个都写明真实约束和一个本周可验证的动作。继续做下去也是正当选择 —— 只要它是被选择的,而不是被默认的。
成为那个「说不」会被采纳的人
当生成的改动变多,约束就移到「能拿出站得住的理由拒掉一个改动」的那个人身上。这种权威是靠在公开场合、反复地、对某个具体系统判断正确挣来的。
前提是在同一个代码库里待到久到你对它的判断靠得住 —— 这和「每十八个月跳一次涨薪」是相冲的。
找一个你这个月批过的生成改动,重新读一遍,专门找你当时漏掉的东西。写下来:你现在还会不会批,以及为什么。
把「智能体能做什么」这件事接过来
总要有人决定一次自动改动能碰什么、从哪里进来。在多数团队里没有人被指派做这件事 —— 这就是为什么它出现在事故复盘里,而不是职位说明里。
至少现在,它是一份没有头衔的责任。要么你有意识地、白纸黑字地接过来,要么它会在第一次出事的时候被安到你头上。
写一页:在你们的仓库里,自动改动目前在没有人经手的情况下能做到什么。发出去,看看谁对「现在已经被允许的范围」有不同看法。
转向「错了在法律上很贵」的地方
支付、安全关键系统、受监管的数据 —— 在这些地方,无人经手的改动本来就不被允许,所以审查与担责是被拨款的,而不是被默认的。
节奏更慢、流程更多,而深度要用年来攒。那是另一种工程,不是「同样的工程换个更安全的房间」。
找一条真正适用于你身边某个系统的监管要求,读一读它到底禁止了什么。大多数工程师从来没有直接读过一条。
转到问题那一侧
解决方案工程、技术产品、开发者体验 —— 这些岗位的价值在于同时理解一套系统和「别人需要它做什么」,而在这里,写代码从来就不是稀缺的那部分。
要求把沟通当成一级能力来练,并且接受一件事:你将不再是最懂这份代码的那个人。
找一个正在用你做的系统的人,坐在旁边二十分钟一句话不说。把他每一次迟疑的地方记下来。
常见问题#
本站收录的那一次随机试验测到的是相反的结果,而其中最值得记住的细节是「测量」与「感觉」之间的落差:16 名资深开源维护者,在他们自己熟悉的仓库里处理真实问题,使用 2025 年前后的工具后耗时多了 19%,而他们估计自己快了 20%。作者不主张这个结论适用于大多数开发者或新项目,而且它已经过去一年。它确立的是:在一个成熟的代码库上,提速不是自动发生的 —— 而且问你自己,得不出答案。
没有人能用一个数字回答这个问题,而两边那些笃定的答案都在卖东西。更有用的问法是「哪一部分」,因为各部分的速度不一样:写常规代码在很大程度上已经由机器完成;审查它写出来的东西已经长成了一份独立的工作;而「带着已知风险决定发不发」几乎没动,因为那是担责,不是能力。与其等一个数字,不如盯一个你自己就能核对的信号:你一周里有多少时间现在花在读不是你写的代码上。
是暴露方式不同,不是更安全 —— 而且这两件事之间的联系值得看清。2022 年底到 2026 年中,AI 暴露度最高档的 22–25 岁群体就业下降约 11%,而几家砍掉初级岗的组织公开承认,他们把「人如何成长为资深」的那条路一起砍掉了。一个不再培养资深的行业,拿到的是一个以后才爆发的供给问题,不是一张现在的安全保证 —— 而在这期间,原本分摊在一个团队里的「教人」的工作,会落到更少的人头上。
本站目前答不了这个问题,而把这一点说出来比猜一个有用。这三者的暴露度确实不同,但我们手上没有能把它们区分开的证据 —— 这里的记录是按资历区分的,不是按技术栈,因为那些研究本来就是那样设计的。任何一个把前端和后端排出高下的笃定说法,都是某个人的印象。证据能支持的是另一种选法:按「在你这个领域里,错了有多贵」来选 —— 而这一条横跨这三个方向。
审查不是你写的代码,并且说得出你为什么否掉某一处。这项能力一直都在这份工作里,却从来不是招人或考核时看的那一项;而它现在是瓶颈,因为生成把工作从「产出」挪到了「判断」。它同时也是让你成为「说不会被采纳的那个人」的那项能力 —— 而那是这份工作里目前看不到替代品的部分。
方法与来源#
- 评估日期
- 2026-09-12
- 任务判断的依据构成
- 1 条有证据支撑 · 5 条平台推断 · 0 条证据不足
- 已核实事件
- 1