VOLOVLO职业自动化风险与转型导航
问 VOLO职业专业企业创业者近期变化方法与证据搜索职业、专业…EN
VLO
VOLO

理解自动化如何改变工作 —— 逐个任务地看,证据摆出来,不确定的地方承认不确定。

问 VOLO职业专业企业创业者近期变化方法与证据关于岗位诊断隐私条款
© 2026 VOLO
职业
全部职业
AI / 软件
翻译 / 口译银行柜员文案客服行政助理测试工程师平面设计师律师助理视频剪辑师会计 / 记账市场营销专员前端工程师数据分析师初级程序员人力资源 / 招聘金融分析师记者销售 / 客户经理后端工程师产品 / UX 设计师业务系统与流程负责人数据工程师律师算法 / 机器学习工程师中高级软件工程师产品经理药师业务合作 / 渠道经理建筑师一线主管 / 团队管理者中小学教师护士企业 AI 落地负责人
RPA / 自助化
运营专员 / 业务运营
机器人
收银员 / 零售店员仓储分拣员流水线装配工厨师电工
自动驾驶
网约车 / 出租车司机卡车司机外卖骑手 / 快递员
专业
全部专业英语 / 外语计算机科学会计学心理学新闻传播金融学 / 经济学法学视觉传达设计市场营销护理学工商管理教育学 / 师范建筑学
指南
问 VOLO企业创业者近期变化岗位诊断方法与证据关于站内搜索
你在看:我在工作我在读书我在经营公司我在做东西
本页任务拆解它是怎么走到这里的近期变化对你意味着什么方法与来源
职业›算法 / 机器学习工程师

算法 / 机器学习工程师

交付的是「行为是学出来的」那种系统 —— 没有人能逐行说明它为什么这么做,而仍然要有人决定它是否好到可以用在人身上。

machine-learning-engineer看你的选择 ↓软件与技术评估于 2026-09-12
自动化影响指数
47/100
低置信度 · 不是失业概率
正在自动化的任务
2/ 6 项
2 项正在被增强
仍由人主导
1/ 6 项
1 项新任务
有证据支撑的判断
0/ 6 项
0 条已核实记录
47/100
自动化影响指数低置信度

这不是失业概率。它把「岗位任务中有多少暴露于自动化」与「采用实际走到了哪一步」合成为一个值 —— 只用于在同一套口径下横向比较职业,除此之外不作他用。

适用范围

适用于构建、评估并运行「学出来的系统」的工程师 —— 推荐、排序、视觉、语音、风控、预测,以及越来越多建立在买来的模型之上的应用。它与其它计算机类页面不在同一个轴上:那几页按层或按资历切,这一页按你交付的是什么切。做新方法的研究员,以及在一家公司里负责把 AI 推下去的人,是另外的工作 —— 后者是「AI 落地负责人」那一页。

本页所有判断均为平台推断,不是已核实证据。

证据库里已有其他职业的已核实记录,但这个职业还一条都没有。在有之前,下面的分析是对任务结构与已知技术能力的推理 —— 就这个职业而言,它没有可追溯来源支撑。我们宁可直说,也不引用未经核实的东西。这里是空的,是我们覆盖上的缺口,不是关于这份工作的结论。

到底什么在变#

分析单位是任务,不是职位名称。职业不会被整体替代 —— 变的是它的任务构成。

正在自动化×2正在被增强×2仍由人主导×1新出现的任务×1

这就是你做的吗?认一下,这一页会缩到只剩与你有关的那一份。

职位名只是一组恰好被打包买走的任务,而没有两个人手里的那一组是一样的。什么都不会被发送出去 —— 它只留在这个浏览器里。

为这个问题做一个模型

正在自动化≈ 平台推断

选一个结构、用你自己的数据训练它、调到指标动起来为止。

AI / 软件
为什么

两股力量,而只有一股是这个站平时说的「自动化」。工具确实把搜索过程自动化了 —— 选结构、调超参从「做」变成了「配」。更大的那股力量性质不同:大量过去必须训点什么才能解决的问题,现在是调用一个别人训好的模型。这项任务不是变得机器可做了,是它的产物变得可以买了。

这还不能说明什么

本站的四个方向词分不出这两种机制,而这个区别对任何据此页做打算的人都要紧:一件因为「可以买」而消失的工作,会在供应商的价格、许可或能力变动时重新出现,而一件「机器学会了做」的工作不会这样回来。它也没有说那些买不到的领域 —— 窄场景、私有数据、延迟受限、受监管 —— 而这些并不罕见。

决定什么才算够好

仍由人主导≈ 平台推断

做出那套测试集、选定那个指标,并说出这东西现在能不能用在真实的人身上。

AI / 软件
为什么

一个学出来的系统,正确性没法被定义,只能被测量 —— 所以那把尺子本身就是交付物,而它必须由知道「在这里犯错要付什么代价」的人来做。一个模型已经见过的基准什么也测不出来,所以做一套诚实的测试集是一份对抗性的工作,不是一份收集数据的工作。模型越强,这项任务越稀缺 —— 被评判的东西越难,评判本身就越难。

这还不能说明什么

这是一条关于工作性质的判断,不是对「有没有人做这件事」的测量。有大量团队根本不做,直接拿供应商公布的基准就上线 —— 那正是这一条描述的失效方式,不是反证;但我们没有任何记录能数出那是多少家。

把数据弄成能学的样子

正在被增强≈ 平台推断

采集、标注、清洗,以及决定什么不要 —— 并且察觉数据说的和世界说的不一样。

AI / 软件
为什么

模型辅助标注与合成数据把这件事的工作量拿走了大半,而那是真的:过去要一个团队干几周的,现在常常一个下午就有初版。没能迁移过去的是「知道哪些样本从一开始就不可能被采集到」—— 而一个只能读到「在场之物」的工具,看不见缺席。

这还不能说明什么

这里没有量任何一个团队在这上面花多少时间,而一个手上已有数据资产的团队和一个从零开始的团队之间,这个答案差一个数量级。用模型去标注「用来训模型的数据」本身也有已知的失效模式,而这条判断没有称量它。

当它悄悄不灵了

正在被增强≈ 平台推断

漂移、上游输入变了、训练数据里从来没有过的季节性 —— 以及「重训、回滚,还是关掉」这个决定。

AI / 软件RPA / 自助化
为什么

检测确实进步了:监控工具现在比一个盯看板的人更早、更好地把分布偏移指出来。拿它怎么办没有动,因为几个选项是在生意层面互相权衡的 —— 重训要花钱而且可能更糟,关掉今天就有看得见的代价,而什么都不做同样是一个决定。

这还不能说明什么

它没有说团队到底监不监控。一个没人看管地跑了一年的模型很常见,而这条判断没有覆盖那种情况 —— 在没有人看的地方,这项任务不是「由人主导」,它只是没有被做。

手工造输入特征

正在自动化≈ 平台推断

凭领域知识,手工设计模型据以学习的那些派生信号。

AI / 软件
为什么

这一项在本站所测量的这段时期开始之前就基本结束了。表示学习在 2010 年代把视觉、语音与文本里手工设计的特征替换掉了,此后这个模式又扩展到表格与序列问题上。它仍然写在这一页上,是因为大量教材至今仍在教它 —— 于是人们带着「这就是这门手艺」的预期进来。

这还不能说明什么

它完全不是关于 2022 至 2026 这个窗口的证据 —— 它比那更早,写在这里是为了让人对得上位置。在某些「不允许出现无法解释的输入」的受监管场景里,领域特征设计仍然承重,而这条判断没有把那部分单独分出来。

为它对人做了什么答复

新出现的任务≈ 平台推断

解释系统对某个人做出的一个判定、证明输入数据配得上这个用途,并在它被质疑时成为那个具名的人。

AI / 软件RPA / 自助化
为什么

新工作,而且它来自监管而不是来自能力:若干市场已经对用在招聘、信贷、教育与公共服务上的系统附加了义务,其中包括「部署方必须确保输入数据与用途相关且足够有代表性」这样的要求。这种形状的义务,必须落在一个懂得模型到底吃了什么的人身上。本站有一条已核实记录正是这样一条条款生效 —— 它挂在部署方那一页(业务系统负责人),因为条款点名的是那个角色。

这还不能说明什么

这段推理指向的那条记录没有挂在这个职业上,而且是刻意的:那条义务点名的是部署方,把它挂在这里等于声称它落在工程师身上,而在多数组织里还没有人被告知它落在谁身上。所以这是关于「这份工作将会落在哪儿」的推断,不是「它已经落在那儿」的证据。要求也因市场、因系统用途而差异极大。

哪些技术在起作用#

四类独立信号。它们刻意不做加总 —— 一个职业暴露于两种技术,不等于风险翻倍。

脑力工作自动化
为这个问题做一个模型决定什么才算够好把数据弄成能学的样子当它悄悄不灵了手工造输入特征为它对人做了什么答复
流程与自助化
当它悄悄不灵了为它对人做了什么答复

它是怎么走到这里的#

指数不是一个静态数字。这是自 ChatGPT 以来,每个能力检查点上它大致会落在哪里 —— 回溯重建,并且如实标注。

回溯重建 · 平台推断每个过去的检查点都是今天回头估的,不是当时测的。34 → 47。
1007550250
未评估
2022 下半年2024 下半年现在

本站唯一一条先急升、然后落回来的曲线,而两半各有一个说得出名字的机制。起点高,是因为手工特征设计在这段时期开始之前就已经被替代了 —— 干这件事的是 2010 年代的表示学习,不是生成式 AI。2023 至 2024 那段陡升**不是机器学会了做这份工作**:是很大比例的问题获得了一个「可以买的替代品」,于是那个定制产物不再必要。2025 年开始的回落是同一次变动的另一半 —— 模型一旦是买来的,剩下的就是判断它在你的问题上灵不灵,而这件事随着系统更强而变难了:一个看起来合理的错答案,比一个明显错的答案更难被抓住。那个峰值要读成「经典任务集最容易被替换的那一刻」,不要读成这个职业正在回去的一个上限。

2022 下半年34通用文本生成进入公众手中。在这之前,暴露度来自已经部署多年的自动化 —— OCR、流程机器人、机器视觉、自助结账、派单算法。 ChatGPT research preview (2022-11-30) ↗
2023 上半年37通用模型开始通过职业考试。初稿质量跨过了「专业工作愿意用」的门槛。 GPT-4 (2023-03-14) ↗
2023 下半年44视觉输入、长上下文与工具调用。模型可以被指向文档、接进系统 —— 这才动得了流程类工作,而不只是写作类。 GPT-4 Turbo:128k 上下文、视觉、工具调用(DevDay) (2023-11-06) ↗
2024 上半年49同等能力大幅降价、变快。没有新东西变得可能,但很多东西变得规模上划算 —— 这才是部署决策改变的时刻。
2024 下半年51会做多步推理的模型;以及第一批「看着屏幕操作电脑」的模型。后者才碰得到「以操作软件为主」的工作。 OpenAI o1(推理);同期 Claude 的 computer use 进入公测 (2024-09-12) ↗
2025 上半年50代理开始端到端操作真实软件,而不只是产出让人去粘贴的文本。同期出现第一批公开回退 —— 自动化之后又部分撤回的组织。 Claude 3.7 Sonnet 与 Claude Code:混合推理 + 命令行编码代理 (2025-02-24) ↗
2025 下半年48长上下文与工具使用从「功能」变成默认。能力仍在提升,但可见的约束从「模型能不能做」转向责任归属、采购与成本。 GPT-5(2025-08-07);Claude Opus 4.5(2025-11-24) (2025-08-07) ↗
2026 上半年47长时程代理落进具体行业流程。采用从「通用」变成「分行业」。 GPT-5.5:「专为实际工作打造」 (2026-04-23) ↗
现在47本次评估 —— 这个点就是职业页上公布的影响指数,所以曲线末端锚在一个本站已经为之负责的数字上。对那些平缓的曲线值得记一句:就在同几周里,一份「让 AI 代理安全操作物理设备」的共享规范开放了研究预览,面向科研机构与先进制造厂。那是第一个把矛头指向「图上几乎不动的那些体力职业」的能力类别。 GPT-6 Astra(2026-09-03);Claude Fable 5.1 / Mythos 5.1(2026-09-01);Model Hardware Standard 研究预览(2026-08-27) (2026-09-03) ↗

曲线平缓不是「安全」的预测。它只是在说:到目前为止,自动化触及了哪些任务 —— 这里动得最少的职业,约束都是物理的或监管的,而这两样都会变。

近期变化#

暂无已核实事件。

这一栏会随着监测流水线采集、去重、分级并关联到上面的任务而逐步填充。这里是空的,意味着我们没有核实到任何东西 —— 不意味着什么都没发生。

「没搜到新闻」不等于「安全」。

这对你意味着什么#

如果你刚入行

课程教的大部分 —— 结构、调参、特征设计 —— 正是这一页标为「被替代」的那部分,而其中一项在你开始学之前就已经被替代了。稀缺的是课程不容易留作业的那一项:做一套模型没见过的测试,以及把「这还不够好」说出口。比你觉得合理的时间更早地靠近一个跑在真实的人身上的系统,哪怕很小。

如果你已有经验

如果你的价值是「知道该用哪个模型」,那份知识贬值得很快,而且还在继续贬值。如果它是「知道这个领域是怎么坏的」—— 在这里答错要付什么代价、哪些输入本来就缺、当人群变了之后一个看起来合理的数字意味着什么 —— 那是变得更稀缺的那一半,因为被评判的东西更难评判了。不好听的那个版本:这个领域近年招的人里,有相当一部分要的是「会把接口调好的人」,而那是另一份工作,天花板也不同。

你的选择#

四个方向,每个都写明真实约束和一个本周可验证的动作。继续做下去也是正当选择 —— 只要它是被选择的,而不是被默认的。

保住并强化

把那把尺子接过来

当模型是买来的,评估就是唯一还属于你的东西 —— 而一套从你们自己的失败里长出来的测试集,供应商供不了。

现实约束

这是一份对着自家产品做对抗的工作 —— 在一家用「发布」衡量进展的公司里,它的社交代价不低。

本周可验证

拿你们团队在引用的那个基准,去查它的数据有没有可能已经在模型的训练集里。如果你排除不掉,那个数字的含义比团队以为的小。

调整职责

去买不到模型的地方

窄领域、私有数据、硬延迟预算,以及不允许出现无法解释的输入的场景 —— 在这些地方,那个「可以买的替代品」并不存在,而经典的那套能力仍然是能力。

现实约束

这些领域奖励的是机器学习之外的某种深度 —— 物理、医学、市场、硬件 —— 而那种深度要花几年,没有捷径。

本周可验证

在你所在的行业里找一个「通用模型明显打不过一个小而专的模型」的问题,把原因写下来。如果你找不到,那同样是一个答案。

相邻转岗

在义务被指派之前先接过来

义务正在附着到「用在人身上的学出来的系统」上,而它们要求有一个能说清模型吃了什么、以及那为什么配得上这个用途的人。在多数团队里,这个人还不存在。

现实约束

它是先有责任、后有头衔,而且要求因市场而异 —— 接过来意味着去读义务的原文,不是读一份摘要。

本周可验证

挑一个你们公司跑在真实的人身上的模型,用一页纸写下:它是用什么数据训练的、谁判断那是合适的。注意那些空白处花了你多久。

常见问题#

我还有多久?

这里各部分是朝相反方向动的,而一个数字会把这件事盖住。为一个具体问题训一个模型,在很大比例的问题上已经被替代 —— 而且不是被「机器学会了做这件事」替代,是被「产物可以买了」替代,而后者是可逆的。判断一个学出来的系统够不够好,则同时变得更难、更稀缺。一个你自己能核对的信号:你最近三件工作里,有几件以「训出一个模型」结束、有几件以「对别人训的模型做出一个判断」结束。第二个数字就是这份工作正在去的方向。

以前要训模型才能做的事,大模型直接就能做了。我这套技能是不是没用了?

有一部分是,而且值得把是哪一部分说准 —— 因为这里的机制不寻常。消失的是那个定制产物,不是一项人的能力:你的问题现在有了一个可以买的替代品。这种消失是会逆转的 —— 供应商的价格、许可、限流或能力一变,活就回来了 —— 而一件机器真正学会做的事不会这样回来。没有消失的是「判断这个替代品在你的问题上到底灵不灵」,而它在同一次变动里变得更难了。

我该学训模型,还是学在模型上面做产品?

把它问成「两套技能二选一」,正是它难回答的原因。两边耐久的位置是同一个:成为那个「关于这东西灵不灵的判断会被采纳」的人。不同的是入场价 —— 在模型上面做产品眼下几乎没有门槛,所以那条道拥挤,而它的天花板取决于你能不能把「好的结果」和「看起来合理的结果」分开。如果你只能把一件事做好,做那个判断。

算法工程师还有需求吗?

需求和暴露度是两个问题,而这一页只回答后一个 —— 这点值得说明,因为它们经常被混为一谈。诚实的观察是:这个头衔现在盖着两份天花板不同的工作 —— 一份训练并评估系统,一份在买来的模型上组装应用 —— 而招聘启事很少把它们分开。接一个岗位之前,问团队上个季度交付了什么、有没有人为它做过一套测试集。答案会告诉你,这个头衔在那里指的是两份工作里的哪一份。

方法与来源#

评估日期
2026-09-12
任务判断的依据构成
0 条有证据支撑 · 6 条平台推断 · 0 条证据不足
已核实事件
0

我们如何评估一个职业 →