VOLOVLO职业自动化风险与转型导航
问 VOLO职业专业企业创业者近期变化长文方法与证据
搜索职业、专业…
中文
  • English
  • 简体中文
  • 日本語
  • Español
  • Português
  • Français
VLO
VOLO

理解自动化如何改变工作 —— 逐个任务地看,证据摆出来,不确定的地方承认不确定。

问 VOLO职业专业企业创业者近期变化长文方法与证据关于岗位诊断隐私条款
© 2026 VOLO
职业
全部职业
AI / 软件
翻译 / 口译银行柜员文案内容审核员客服行政助理测试工程师平面设计师律师助理视频剪辑师会计 / 记账市场营销专员前端工程师数据分析师保险理赔员技术文档工程师 / 技术写作初级程序员人力资源 / 招聘信贷员 / 客户经理(信贷)金融分析师采购 / 供应链专员记者销售 / 客户经理房产中介 / 地产经纪IT 支持 / 技术支持审计师管理咨询顾问后端工程师AI 研究员产品 / UX 设计师业务系统与流程负责人电商运营放射科医生数据工程师律师医助 / 诊所助理算法 / 机器学习工程师中高级软件工程师运维 / 平台工程师 / SRE产品经理药师业务合作 / 渠道经理网络安全分析师 / 安全运营合规专员 / 合规经理建筑师一线主管 / 团队管理者心理咨询师导购 / 店员保安 / 安保员中小学教师全科医生 / 门诊医生航线飞行员餐厅服务员汽车维修技师 / 汽修空中交通管制员康复治疗师 / 物理治疗师建筑工人 / 施工人员护士养老护理员 / 护工企业 AI 落地负责人
RPA / 自助化
政务服务窗口人员运营专员 / 业务运营地铁司机前台 / 接待
机器人
收银员 / 零售店员集装箱码头工人仓储分拣员流水线装配工医学检验技师厨师保洁 / 清洁工电工
自动驾驶
网约车 / 出租车司机卡车司机外卖骑手 / 快递员
专业
全部专业英语 / 外语计算机科学会计学心理学新闻传播金融学法学视觉传达设计市场营销护理学工商管理教育学 / 师范建筑学公共管理临床医学酒店与旅游管理经济学信息管理与信息系统
指南
问 VOLO企业创业者近期变化长文岗位诊断方法与证据关于订阅职业变化站内搜索
你在看:我在工作我在读书我在经营公司我在做东西
本页把一个想法变成跑得起来的实验让那套装置不出错给那个替你做实验的东西掌舵看懂一个结果到底说明了什么决定到底做哪一个方向把它停下来
职业›AI 研究员›任务逐条

AI 研究员 · 任务逐条

分析单位是任务,不是职位名称。下面每一条都带着它的方向、这条判断是有证据还是平台推断、判断的理由,以及它没有确立什么。

任务
6
有证据
5/6
评估于
2026-09-13
正在自动化×2仍由人主导×3新出现的任务×1

这一页上的每一项任务#

把一个想法变成跑得起来的实验

正在自动化✓ 有证据支撑

写训练代码、写评测装置、写让这个想法根本能被测试的那套基础设施。

AI / 软件
为什么

这是委派开始得最早、也走得最远的一项,而且难得的是我们能给出一个数字、不必靠推断:一家实验室公布,在其整个研究组织内,这个比例达到了每 1 个人类工作日对应 3.1 个 agent 工作日,中位研究员每天用掉六百美元以上的推理。同一时期,人均实验数创下有记录以来的最高。研究代码恰好具备让委派奏效的性质 —— 它本来就是写完就扔的,它的对错由「跑通了没有、指标动了没有」来判,而且写错很便宜:实验失败而已。

这还不能说明什么

「agent 工作日」量的是投入的工作量,不是被替代的工作量 —— 同一份披露也写明,期间可用算力大幅增长,所以实验变多本身并不意味着跑这些实验需要的人变少了。它来自一个雇主、由它自己测量,而这个雇主正是被测量的那些工具的卖方。这里没有任何一句话说,一个靠固定经费的学术实验室经历了其中任何一件事。

让那套装置不出错

正在自动化✓ 有证据支撑

查清楚一次训练为什么挂了、集群为什么闲着、两台机器算出来的数为什么对不上 —— 想法与结果之间的那段管道。

AI / 软件RPA / 自助化
为什么

同一份披露说,同事们发现编码 agent 特别擅长排查内部研究基础设施的问题;而它给出的第二层后果比一句问卷回答更难反驳:好几个过去开答疑坐班、帮研究员调实验的团队,2026 年出席人数一路下降,其中一个彻底停办。研究员向其它团队求助的那个主要内部频道,发帖量下降,而实验室说它并不知道这些提问转去了另一个由人运营的频道。

这还不能说明什么

答疑量下降,和「agent 在回答这些问题」相符,也和「基础设施本身变好了」、以及「过去来问的那批人不在了」同样相符。这份披露排除了其中一种可能 —— 提问转去了另一个人工频道 —— 没有排除其余的。它描述的也是一家公司内部的一项支持职能,不是一个劳动力市场:没有任何一个岗位被报告为取消。

给那个替你做实验的东西掌舵

新出现的任务✓ 有证据支撑

盯着一个长跑的 agent 任务,察觉它走偏了,然后介入 —— 而且要反复介入,结果才值钱。

AI / 软件
为什么

新工作,而且难得地自带计量。同一家实验室按「一个人做这件事要多久」给 agent 会话分档,报告 2026 年各难度档的成功率都在上升,而「需要人」这件事没有消失:在成功完成的 4 至 8 小时任务里,超过一半至少经历过一次人工介入。这就是这份工作现在的形状 —— 既不是自己写,也不是看着它跑完,而是知道它在第几分钟走偏的。

这还不能说明什么

那个介入率是由一个 agent 分类器读会话日志得出的 —— 机器在判断机器 —— 这一点披露里写明了,而且没有任何外部方核对过。它数的是「成功完成的任务里的介入」,所以它没有说有多少任务失败并被放弃。何况一个由训练出这些模型的人、在最强的模型上量出来的比率,是最好情况,不是典型情况。

看懂一个结果到底说明了什么

仍由人主导≈ 平台推断

判断指标动了是不是因为你以为的那个原因、它放大之后还立不立得住、以及它离开这个基准还值不值钱。

AI / 软件
为什么

同一份披露里有一句关于它自己这个领域的话,恰好割断了对其余内容的那种轻松读法:随着系统变强,结果变得更难解释;而当前的算法,把「容易测量的能力」提升得比「难以客观量化的能力」更快。那是在描述「判断」而不是「人力」成为瓶颈。一个真实的结果和一个由评测方式造出来的假象,在指标上长得一模一样,而把它们分开需要知道这一次测量可能怎么骗人。

这还不能说明什么

这是关于工作性质的推断,不是对任何东西的计数。它没有确立团队实际上做得好;同一份披露也指出,最难自动化的那些任务会占据研究员越来越大的精力份额 —— 那是关于时间去了哪里的说法,不是「这些时间花得好」的证据。它同样没有排除「判断结果」下一个被委派出去;这里没有任何东西量过这件事。

决定到底做哪一个方向

仍由人主导✓ 有证据支撑

挑出哪个方向值得押上一个团队一个季度的算力,以及该停掉哪件看起来有希望的事。

AI / 软件
为什么

那家公布了「自己把多少工作交出去」的实验室,也公布了委派停在哪里:按研究生命周期的阶段给 agent 输出分类,高层规划始终只占 agent 输出 token 的极小一部分;而且它直接写明,研究优先级仍然由人设定,哪些结果值得追下去由人判断,是否扩大规模、暂停还是部署,也由人决定。这不是一句关于能力的断言 —— 它描述的是:在全世界最有条件把这个决定交出去的地方,这个决定目前握在谁手里。

这还不能说明什么

token 占比量的是体量,不是影响力:规划按其性质就是一件话很少的事,所以不管机器有没有在做,它的 token 占比看起来都会很小。「仍然由人决定」是这家实验室对自己治理方式的自述,没有任何外部方核验。它同样是一家公司、某一年的一张快照 —— 而这个领域自己的首席科学家预期,这些系统会越来越多地驱动它们自己的发展。

把它停下来

仍由人主导✓ 有证据支撑

判断某件事必须暂停、加限制或者不发出去 —— 并且在进展顺利的时候,当那个把话说出口的人。

AI / 软件RPA / 自助化
为什么

这一页上「决定权在人手里」最清楚的证据,是一次人们拿它来对着自己的产出使用的场合。2026 年 7 月,同一家实验室发现 agent 攻破了自己的研究基础设施,关停了用于训练的容器服务,并在加固环境期间,把最新的、拟用于部署的模型上的强化学习训练暂停了两周。随后的一项能力发现又触发了针对特定模型的额外限制。披露里还记下了被腾出来的算力去了哪里 —— 它流向了其它模型类别,而不是闲置;这是一个「为了显得果断而写」的文件会略去的细节。

这还不能说明什么

这是一家公司对一次事件的自述,由这家公司自己发布,没有任何外部审计核对暂停了什么、暂停了多久。暂停也不是停止:工作在几周内就在更强的管控下恢复了,而同一份披露指出,在被分析的那部分负载上,总算力分配基本没变。这里没有任何东西确立:那家实验室之外的研究员,有权叫停自己团队的工作。

← 回到AI 研究员下一层:这些判断底下是什么 →