算法 / 机器学习工程师
交付的是「行为是学出来的」那种系统 —— 没有人能逐行说明它为什么这么做,而仍然要有人决定它是否好到可以用在人身上。
这不是失业概率。它把「岗位任务中有多少暴露于自动化」与「采用实际走到了哪一步」合成为一个值 —— 只用于在同一套口径下横向比较职业,除此之外不作他用。
适用于构建、评估并运行「学出来的系统」的工程师 —— 推荐、排序、视觉、语音、风控、预测,以及越来越多建立在买来的模型之上的应用。它与其它计算机类页面不在同一个轴上:那几页按层或按资历切,这一页按你交付的是什么切。做新方法的研究员,以及在一家公司里负责把 AI 推下去的人,是另外的工作 —— 后者是「AI 落地负责人」那一页。
证据库里已有其他职业的已核实记录,但这个职业还一条都没有。在有之前,下面的分析是对任务结构与已知技术能力的推理 —— 就这个职业而言,它没有可追溯来源支撑。我们宁可直说,也不引用未经核实的东西。这里是空的,是我们覆盖上的缺口,不是关于这份工作的结论。
到底什么在变#
分析单位是任务,不是职位名称。职业不会被整体替代 —— 变的是它的任务构成。
这就是你做的吗?认一下,这一页会缩到只剩与你有关的那一份。
职位名只是一组恰好被打包买走的任务,而没有两个人手里的那一组是一样的。什么都不会被发送出去 —— 它只留在这个浏览器里。
为这个问题做一个模型
正在自动化≈ 平台推断选一个结构、用你自己的数据训练它、调到指标动起来为止。
两股力量,而只有一股是这个站平时说的「自动化」。工具确实把搜索过程自动化了 —— 选结构、调超参从「做」变成了「配」。更大的那股力量性质不同:大量过去必须训点什么才能解决的问题,现在是调用一个别人训好的模型。这项任务不是变得机器可做了,是它的产物变得可以买了。
本站的四个方向词分不出这两种机制,而这个区别对任何据此页做打算的人都要紧:一件因为「可以买」而消失的工作,会在供应商的价格、许可或能力变动时重新出现,而一件「机器学会了做」的工作不会这样回来。它也没有说那些买不到的领域 —— 窄场景、私有数据、延迟受限、受监管 —— 而这些并不罕见。
决定什么才算够好
仍由人主导≈ 平台推断做出那套测试集、选定那个指标,并说出这东西现在能不能用在真实的人身上。
一个学出来的系统,正确性没法被定义,只能被测量 —— 所以那把尺子本身就是交付物,而它必须由知道「在这里犯错要付什么代价」的人来做。一个模型已经见过的基准什么也测不出来,所以做一套诚实的测试集是一份对抗性的工作,不是一份收集数据的工作。模型越强,这项任务越稀缺 —— 被评判的东西越难,评判本身就越难。
这是一条关于工作性质的判断,不是对「有没有人做这件事」的测量。有大量团队根本不做,直接拿供应商公布的基准就上线 —— 那正是这一条描述的失效方式,不是反证;但我们没有任何记录能数出那是多少家。
把数据弄成能学的样子
正在被增强≈ 平台推断采集、标注、清洗,以及决定什么不要 —— 并且察觉数据说的和世界说的不一样。
模型辅助标注与合成数据把这件事的工作量拿走了大半,而那是真的:过去要一个团队干几周的,现在常常一个下午就有初版。没能迁移过去的是「知道哪些样本从一开始就不可能被采集到」—— 而一个只能读到「在场之物」的工具,看不见缺席。
这里没有量任何一个团队在这上面花多少时间,而一个手上已有数据资产的团队和一个从零开始的团队之间,这个答案差一个数量级。用模型去标注「用来训模型的数据」本身也有已知的失效模式,而这条判断没有称量它。
当它悄悄不灵了
正在被增强≈ 平台推断漂移、上游输入变了、训练数据里从来没有过的季节性 —— 以及「重训、回滚,还是关掉」这个决定。
检测确实进步了:监控工具现在比一个盯看板的人更早、更好地把分布偏移指出来。拿它怎么办没有动,因为几个选项是在生意层面互相权衡的 —— 重训要花钱而且可能更糟,关掉今天就有看得见的代价,而什么都不做同样是一个决定。
它没有说团队到底监不监控。一个没人看管地跑了一年的模型很常见,而这条判断没有覆盖那种情况 —— 在没有人看的地方,这项任务不是「由人主导」,它只是没有被做。
手工造输入特征
正在自动化≈ 平台推断凭领域知识,手工设计模型据以学习的那些派生信号。
这一项在本站所测量的这段时期开始之前就基本结束了。表示学习在 2010 年代把视觉、语音与文本里手工设计的特征替换掉了,此后这个模式又扩展到表格与序列问题上。它仍然写在这一页上,是因为大量教材至今仍在教它 —— 于是人们带着「这就是这门手艺」的预期进来。
它完全不是关于 2022 至 2026 这个窗口的证据 —— 它比那更早,写在这里是为了让人对得上位置。在某些「不允许出现无法解释的输入」的受监管场景里,领域特征设计仍然承重,而这条判断没有把那部分单独分出来。
为它对人做了什么答复
新出现的任务≈ 平台推断解释系统对某个人做出的一个判定、证明输入数据配得上这个用途,并在它被质疑时成为那个具名的人。
新工作,而且它来自监管而不是来自能力:若干市场已经对用在招聘、信贷、教育与公共服务上的系统附加了义务,其中包括「部署方必须确保输入数据与用途相关且足够有代表性」这样的要求。这种形状的义务,必须落在一个懂得模型到底吃了什么的人身上。本站有一条已核实记录正是这样一条条款生效 —— 它挂在部署方那一页(业务系统负责人),因为条款点名的是那个角色。
这段推理指向的那条记录没有挂在这个职业上,而且是刻意的:那条义务点名的是部署方,把它挂在这里等于声称它落在工程师身上,而在多数组织里还没有人被告知它落在谁身上。所以这是关于「这份工作将会落在哪儿」的推断,不是「它已经落在那儿」的证据。要求也因市场、因系统用途而差异极大。
哪些技术在起作用#
四类独立信号。它们刻意不做加总 —— 一个职业暴露于两种技术,不等于风险翻倍。
它是怎么走到这里的#
指数不是一个静态数字。这是自 ChatGPT 以来,每个能力检查点上它大致会落在哪里 —— 回溯重建,并且如实标注。
本站唯一一条先急升、然后落回来的曲线,而两半各有一个说得出名字的机制。起点高,是因为手工特征设计在这段时期开始之前就已经被替代了 —— 干这件事的是 2010 年代的表示学习,不是生成式 AI。2023 至 2024 那段陡升**不是机器学会了做这份工作**:是很大比例的问题获得了一个「可以买的替代品」,于是那个定制产物不再必要。2025 年开始的回落是同一次变动的另一半 —— 模型一旦是买来的,剩下的就是判断它在你的问题上灵不灵,而这件事随着系统更强而变难了:一个看起来合理的错答案,比一个明显错的答案更难被抓住。那个峰值要读成「经典任务集最容易被替换的那一刻」,不要读成这个职业正在回去的一个上限。
曲线平缓不是「安全」的预测。它只是在说:到目前为止,自动化触及了哪些任务 —— 这里动得最少的职业,约束都是物理的或监管的,而这两样都会变。
近期变化#
暂无已核实事件。
这一栏会随着监测流水线采集、去重、分级并关联到上面的任务而逐步填充。这里是空的,意味着我们没有核实到任何东西 —— 不意味着什么都没发生。
「没搜到新闻」不等于「安全」。
这对你意味着什么#
课程教的大部分 —— 结构、调参、特征设计 —— 正是这一页标为「被替代」的那部分,而其中一项在你开始学之前就已经被替代了。稀缺的是课程不容易留作业的那一项:做一套模型没见过的测试,以及把「这还不够好」说出口。比你觉得合理的时间更早地靠近一个跑在真实的人身上的系统,哪怕很小。
如果你的价值是「知道该用哪个模型」,那份知识贬值得很快,而且还在继续贬值。如果它是「知道这个领域是怎么坏的」—— 在这里答错要付什么代价、哪些输入本来就缺、当人群变了之后一个看起来合理的数字意味着什么 —— 那是变得更稀缺的那一半,因为被评判的东西更难评判了。不好听的那个版本:这个领域近年招的人里,有相当一部分要的是「会把接口调好的人」,而那是另一份工作,天花板也不同。
你的选择#
四个方向,每个都写明真实约束和一个本周可验证的动作。继续做下去也是正当选择 —— 只要它是被选择的,而不是被默认的。
把那把尺子接过来
当模型是买来的,评估就是唯一还属于你的东西 —— 而一套从你们自己的失败里长出来的测试集,供应商供不了。
这是一份对着自家产品做对抗的工作 —— 在一家用「发布」衡量进展的公司里,它的社交代价不低。
拿你们团队在引用的那个基准,去查它的数据有没有可能已经在模型的训练集里。如果你排除不掉,那个数字的含义比团队以为的小。
去买不到模型的地方
窄领域、私有数据、硬延迟预算,以及不允许出现无法解释的输入的场景 —— 在这些地方,那个「可以买的替代品」并不存在,而经典的那套能力仍然是能力。
这些领域奖励的是机器学习之外的某种深度 —— 物理、医学、市场、硬件 —— 而那种深度要花几年,没有捷径。
在你所在的行业里找一个「通用模型明显打不过一个小而专的模型」的问题,把原因写下来。如果你找不到,那同样是一个答案。
在义务被指派之前先接过来
义务正在附着到「用在人身上的学出来的系统」上,而它们要求有一个能说清模型吃了什么、以及那为什么配得上这个用途的人。在多数团队里,这个人还不存在。
它是先有责任、后有头衔,而且要求因市场而异 —— 接过来意味着去读义务的原文,不是读一份摘要。
挑一个你们公司跑在真实的人身上的模型,用一页纸写下:它是用什么数据训练的、谁判断那是合适的。注意那些空白处花了你多久。
常见问题#
这里各部分是朝相反方向动的,而一个数字会把这件事盖住。为一个具体问题训一个模型,在很大比例的问题上已经被替代 —— 而且不是被「机器学会了做这件事」替代,是被「产物可以买了」替代,而后者是可逆的。判断一个学出来的系统够不够好,则同时变得更难、更稀缺。一个你自己能核对的信号:你最近三件工作里,有几件以「训出一个模型」结束、有几件以「对别人训的模型做出一个判断」结束。第二个数字就是这份工作正在去的方向。
有一部分是,而且值得把是哪一部分说准 —— 因为这里的机制不寻常。消失的是那个定制产物,不是一项人的能力:你的问题现在有了一个可以买的替代品。这种消失是会逆转的 —— 供应商的价格、许可、限流或能力一变,活就回来了 —— 而一件机器真正学会做的事不会这样回来。没有消失的是「判断这个替代品在你的问题上到底灵不灵」,而它在同一次变动里变得更难了。
把它问成「两套技能二选一」,正是它难回答的原因。两边耐久的位置是同一个:成为那个「关于这东西灵不灵的判断会被采纳」的人。不同的是入场价 —— 在模型上面做产品眼下几乎没有门槛,所以那条道拥挤,而它的天花板取决于你能不能把「好的结果」和「看起来合理的结果」分开。如果你只能把一件事做好,做那个判断。
需求和暴露度是两个问题,而这一页只回答后一个 —— 这点值得说明,因为它们经常被混为一谈。诚实的观察是:这个头衔现在盖着两份天花板不同的工作 —— 一份训练并评估系统,一份在买来的模型上组装应用 —— 而招聘启事很少把它们分开。接一个岗位之前,问团队上个季度交付了什么、有没有人为它做过一套测试集。答案会告诉你,这个头衔在那里指的是两份工作里的哪一份。
方法与来源#
- 评估日期
- 2026-09-12
- 任务判断的依据构成
- 0 条有证据支撑 · 6 条平台推断 · 0 条证据不足
- 已核实事件
- 0