VOLOVLO职业自动化风险与转型导航
问 VOLO职业专业企业创业者近期变化长文方法与证据搜索职业、专业…EN
VLO
VOLO

理解自动化如何改变工作 —— 逐个任务地看,证据摆出来,不确定的地方承认不确定。

问 VOLO职业专业企业创业者近期变化长文方法与证据关于岗位诊断隐私条款
© 2026 VOLO
职业
全部职业
AI / 软件
翻译 / 口译银行柜员文案客服行政助理测试工程师平面设计师律师助理视频剪辑师会计 / 记账市场营销专员前端工程师数据分析师保险理赔员初级程序员人力资源 / 招聘金融分析师采购 / 供应链专员记者销售 / 客户经理房产中介 / 地产经纪审计师后端工程师AI 研究员产品 / UX 设计师业务系统与流程负责人放射科医生数据工程师律师算法 / 机器学习工程师中高级软件工程师产品经理药师业务合作 / 渠道经理建筑师一线主管 / 团队管理者心理咨询师中小学教师护士企业 AI 落地负责人
RPA / 自助化
政务服务窗口人员运营专员 / 业务运营
机器人
收银员 / 零售店员仓储分拣员流水线装配工厨师电工
自动驾驶
网约车 / 出租车司机卡车司机外卖骑手 / 快递员
专业
全部专业英语 / 外语计算机科学会计学心理学新闻传播金融学 / 经济学法学视觉传达设计市场营销护理学工商管理教育学 / 师范建筑学公共管理
指南
问 VOLO企业创业者近期变化长文岗位诊断方法与证据关于订阅职业变化站内搜索
按身份进入:我在工作我在读书我在经营公司我在做东西
本页两家公司、技术栈的两层,同一套机制Airbnb 还公布了天花板 —— 那才是更少见的东西反面情形:把裁判拿走,方向就反过来四个基准从另一侧说了同一件事当没有裁判的活直接发出去时,会发生什么星期一可以拿它做什么它没有建立什么本文引到的全部记录
长文›我这份工作里,哪些部分会真的被 AI 接手?我怎么能提前判断?

这一篇回答的问题

真的被自动化掉的那些任务,共同点只有一个 —— 而且不是「简单」

不是这件事有多难,也不是它薪水多高。真正预测「这项任务动没动」的性质是:有没有一个人以外的东西能说出「这不对,再来一次」—— 而且能整夜说上一千遍而不累。

2026-09-1314 处引用,每一处都可点开

两家公司、技术栈的两层,同一套机制

Airbnb 公布了它把将近 3,500 个 React 组件测试文件从一个测试框架迁到另一个的全过程:六周,对照的人工估算是一年半,而首次四小时的批量运行就清掉了 75% 的文件。亚马逊公布了它把自己数以万计的生产 Java 应用升到了更新的 Java 版本,并估计人工做完等于四千五百多人年的开发工作。

两件事都不是在写新软件,都是在改「已经存在、而且必须继续工作」的软件。而它们成立的原因,两家公司都写得很明白:这份活的每一步都有一个自动裁判。编译器驳回编译不过的;测试套件抓住能编译但是错的那大部分;检查器和类型检查抓住剩下的。Airbnb 把整个迁移建成了一台状态机,一个文件只有在上一道检查通过之后才前进,然后就是单纯地重试 —— 大多数文件在十次尝试之内完成。

全部的窍门就在这儿,而且值得用大白话说出来:模型在这件事上并不比人强。它是被允许出错的 —— 便宜地出错、出错上千次、而且没有人盯着。一个工程师不可能在同一个文件上错一百次。一个循环可以。

这一节的依据
  • Airbnb 称把将近 3,500 个 React 组件测试文件从 Enzyme 迁到 React Testing Library 用了六周,而人工估算是一年半
  • 亚马逊称用智能体把自己数以万计的生产 Java 应用从 Java 8 或 11 升到了 Java 17,并估计人工做完等于四千五百多人年的开发工作

Airbnb 还公布了天花板 —— 那才是更少见的东西

有百分之三的文件没能过去。它们每一个都已经被重试了五十到一百次,团队才停手,改由人工完成。这个数字比它上面那个 97% 更有用,因为它测量的是「即使重试几乎不要钱,自动化也够不着的那一部分」。

还要注意团队说难啃的那部分是靠什么起效的:不是把提示词写得更好,而是挑对放到模型面前的相关文件 —— 最多五十个,提示长到十万 token。稀缺的输入是「知道这个代码库里哪些部分是相关的」。那是一个关于某家公司具体代码的判断,而做出它的是在那里上班的人。

这一节的依据
  • Airbnb 称把将近 3,500 个 React 组件测试文件从 Enzyme 迁到 React Testing Library 用了六周,而人工估算是一年半

反面情形:把裁判拿走,方向就反过来

METR 做过一次随机对照试验:十六位有经验的开源维护者,246 个他们熟悉的代码库上的真实 issue。用 2025 年那一代工具,他们慢了 19%。而他们自己认为快了 20%。同样的技术,用在「正确答案无法被机械判定、而开发者本人已经掌握上下文」的工作上,把数字推向了另一个方向 —— 并且把开发者的感觉推向了和测量相反的方向。

最后那一点,正是本站不把自我报告当作证据的原因。试验里的人有经验、有动力,而他们对自己速度的判断错了大约四十个百分点。

这一节的依据
  • METR 对 16 名资深开源开发者、246 个真实问题的随机试验发现:使用 2025 年初的 AI 工具后耗时多 19%,而他们自认为快了 20%

四个基准从另一侧说了同一件事

Spider 2.0 把企业数据问题放到真实数仓上问 —— 上千列、好几种 SQL 方言、要翻的文档和一个项目代码库。代码智能体解出了其中 21.3%,而同一类任务的学术版本是 91.2%。Beaver 用真实企业数仓的查询日志构建,在公开基准读作 80 到 90 分的地方,给一个普通大模型打了零分。在 Finance Agent Benchmark 的 537 道由专家依据近期财报文件撰写的题目上,最好的模型离一名分析师还差得远。

OpenAI 的 GDPval 收集了 44 个职业的真实交付物,让同行专家盲评模型产出,它直接报告了那条梯度:胜率在耗时零到两小时的任务上最高,并随任务变长稳定下降。一项任务跑得越久,其中就有越多部分是「在结束之前没有任何东西能判定对错」的决定。

这些没有一条是在说模型有多聪明。它们说的是「裁判在哪里失效」。当正确答案取决于这家公司里哪张表才是真的、两条重复记录留哪一条、或者客户其实想说什么的时候,除了人以外没有东西能给出答案。

这一节的依据
  • 在 632 个取自真实数仓的企业数据工作流上,代码智能体解出 21.3% —— 同一类任务的学术版本是 91.2%
  • 在用真实企业数仓查询日志构建的 text-to-SQL 基准 Beaver 上,纯 LLM 得分为零、智能体方案约 10%,而公开基准上的成绩是 80% 至 90% 以上
  • 在 Finance Agent Benchmark(537 道由业内专家基于近期 SEC 申报文件出的题)上,表现最好的 OpenAI o3 准确率 46.8%,每题平均成本 3.79 美元
  • OpenAI 的 GDPval 基准收集了采购岗真实的交付物,让同行专家盲评模型产出与人的产出

当没有裁判的活直接发出去时,会发生什么

美国联邦法院已经因为诉状引用了不存在的判例而处罚律师 —— 一起罚款五千美元,另一起吊销了临时出庭资格。一份被多家报纸采用的夏季书单在《芝加哥太阳时报》和《费城询问报》上刊出,里面的书从未被写过。Crunchyroll 某部动画首播的德语字幕里出现了「ChatGPT 说……」这一行。此后佛罗里达州最高法院修改了规则,使得在诉状上签字本身就构成对其中所引法律依据的一项陈述。

这些不是笑话,它们和前面的成功是同一个结构。检查那一步是机械的,机器就做了。检查那一步是一个人、而这个人为了省掉检查而被拿掉时,错误就到了外面 —— 然后由法院、编辑或监管机构来当裁判,事后来当,而且代价高得多。

这一节的依据
  • 美国联邦法院因两名律师及其事务所提交引用六个 ChatGPT 编造判例的文书而处以 5,000 美元罚款,同时指出使用可靠的 AI 工具本身并无不当
  • 怀俄明州联邦法院对三名律师处以罚款并撤销其中一人的临时出庭资格 —— 他们提交的动议引用九则判例,其中八则并不存在
  • 佛罗里达州最高法院依职权修订第 2.515(d)(2) 条:签署文书即表示所引法律依据真实存在且引用准确,不一致的文书可处制裁,2026 年 6 月 15 日生效
  • 《芝加哥太阳时报》与《费城问询报》刊出一份含不存在书目的辛迪加夏日书单;撰稿人承认使用了 AI 工具,特刊未经编辑部审核
  • Crunchyroll 一部新番的德语字幕出现「ChatGPT said…」;公司称第三方供应商使用了 AI 生成字幕,违反双方协议

星期一可以拿它做什么

把你自己的待办拿出来,给每一项标上「怎么才算做完」:是一个不需要你就会出现的绿勾,还是一个人看过。第一张单子上的东西正在变便宜,不管你在哪个行业。知道这张单子在你自己这份工作里有多长,比任何公布的百分比都值钱,而且没有别人能替你算出来。

然后看第二张单子,问一个更难的问题:你做的那些检查,定你预算的人看得见吗?这些记录里反复出现的模式是,审核那一步是最先被砍掉的,因为它不产出任何可交付物 —— 而它缺席的后果,要过两个季度才显形。

这一节的依据
  • 让人真的用起来
  • 让跑出来的数字有意义

这一篇没有建立什么

「自动裁判」这条性质,解释的是我们手上这些案例里哪些任务动了;它不是定律,也不做预测。这里最有力的两条记录,是公司自己发布自己工程的结果、并附上自己算的反事实,而外部没有人核过。这里也没有任何一句建立了有人失去工作:这些部署没有一条报告了人数变化,我们也不这样说。另外,一项任务今天没有自动裁判并不等于安全:它意味着当前的工具没有便宜的办法在它上面迭代 —— 那是一句关于工具的话。

本文引到的全部记录

每一条都能打开完整记录:来源与来源层级、日期、适用范围、核实人,以及它没有建立什么。

  1. Airbnb 称把将近 3,500 个 React 组件测试文件从 Enzyme 迁到 React Testing Library 用了六周,而人工估算是一年半 — The Airbnb Tech Blog (Airbnb's own engineering blog)
  2. 亚马逊称用智能体把自己数以万计的生产 Java 应用从 Java 8 或 11 升到了 Java 17,并估计人工做完等于四千五百多人年的开发工作 — AWS DevOps & Developer Productivity Blog (Amazon's own)
  3. METR 对 16 名资深开源开发者、246 个真实问题的随机试验发现:使用 2025 年初的 AI 工具后耗时多 19%,而他们自认为快了 20% — METR — study report
  4. 在 632 个取自真实数仓的企业数据工作流上,代码智能体解出 21.3% —— 同一类任务的学术版本是 91.2% — Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows (arXiv:2411.07763)
  5. 在用真实企业数仓查询日志构建的 text-to-SQL 基准 Beaver 上,纯 LLM 得分为零、智能体方案约 10%,而公开基准上的成绩是 80% 至 90% 以上 — BLOG@CACM (Stonebraker & Chen, MIT)
  6. 在 Finance Agent Benchmark(537 道由业内专家基于近期 SEC 申报文件出的题)上,表现最好的 OpenAI o3 准确率 46.8%,每题平均成本 3.79 美元 — arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu)
  7. OpenAI 的 GDPval 基准收集了采购岗真实的交付物,让同行专家盲评模型产出与人的产出 — GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (OpenAI, arXiv:2510.04374)
  8. 美国联邦法院因两名律师及其事务所提交引用六个 ChatGPT 编造判例的文书而处以 5,000 美元罚款,同时指出使用可靠的 AI 工具本身并无不当 — Mata v. Avianca, Inc. (S.D.N.Y., 22 June 2023) — opinion and order on sanctions, via CourtListener
  9. 怀俄明州联邦法院对三名律师处以罚款并撤销其中一人的临时出庭资格 —— 他们提交的动议引用九则判例,其中八则并不存在 — US District Court, D. Wyo. — Wadsworth v. Walmart, 2:23-cv-118-KHR, ECF No. 181 (order of Judge Kelly H. Rankin)
  10. 佛罗里达州最高法院依职权修订第 2.515(d)(2) 条:签署文书即表示所引法律依据真实存在且引用准确,不一致的文书可处制裁,2026 年 6 月 15 日生效 — Supreme Court of Florida, No. SC2026-0673 — In re: Amendments to Florida Rule of General Practice and Judicial Administration 2.515 (2026-05-28)
  11. 《芝加哥太阳时报》与《费城问询报》刊出一份含不存在书目的辛迪加夏日书单;撰稿人承认使用了 AI 工具,特刊未经编辑部审核 — NBC News
  12. Crunchyroll 一部新番的德语字幕出现「ChatGPT said…」;公司称第三方供应商使用了 AI 生成字幕,违反双方协议 — Engadget
  13. 让人真的用起来 — 任务,属于 企业 AI 落地负责人
  14. 让跑出来的数字有意义 — 任务,属于 业务系统与流程负责人