近期变化
这里每一条都是已核实、并且关联到具体职业与任务的事件。这是证据引擎对外的一面,不是新闻流:一条事件只有在有人读过来源、并把它连到某个任务判断之后才会出现。
37 条已核实记录,覆盖 30 个职业。阶段标签说明一条事件能在多大程度上改变评估;这里没有任何东西会自动改变影响指数。
Waymo 在丹佛、圣迭戈和坦帕向公众开放无人驾驶付费乘车,其在美国无人载客的城市增至 14 个
适用范围:仅美国;每个城市的服务区都有电子围栏并排除部分路况。公司博客,发布日期 2026-09-01。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
到 2026 年 7 月,写作类岗位从英国广告公司招聘的约六分之一降到约三十分之一,同期广告公司总招聘量上升 24%
适用范围:英国广告公司的招聘岗位,统计口径是「占该行业全部招聘的比例」—— 不是就业人数,也不含企业内部与自由职业文案。占比下降可能因为别的岗位在长;这里的情况是总量在涨而写作类涨得远少。
这一阶段能说明什么:招聘、人数、工时或职责出现可验证变化。权重最高 —— 但因果归因仍需论证,不能默认。
纽约一学区暂停已批准的 6 万美元人形教学机器人,州教育部门、教师工会与家长提出异议
适用范围:一个乡村学区、一台固定式机器人,是给高中机器人课买的教学辅助设备 —— 不是一套上课的系统。拦住它的是采购、学生数据协议与工会反对,不是这台设备能做什么的上限。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
百事与 Gatik 启动无人货运合作:车内无安全员,在美国三州为约 250 个零售点送货
适用范围:德州、亚利桑那与阿肯色三州内固定的中段线路(高速与地面道路),服务零售配送;一名远程监督者同时看管数台车。不能说明长途、未测绘线路,也不涉及仍由人承担的场院与月台作业。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Abridge 将环境式病历记录工具开放给旗下全部 250 多家医疗系统客户的护士,其中数家已具名在用
适用范围:美国的医疗系统,且只涉及护理文书这一项任务。「对 250 多家客户开放」不等于这些机构都在用 —— 文中具名的只有数家。不涉及占一个班次大部分时间的直接照护。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
爱沙尼亚「AI 跃进」试点覆盖全部 154 所高中(约 2 万学生、4900 名教师);教师自 2025 年 8 月起获得 ChatGPT 与 Gemini 及培训,超六成每周使用
适用范围:一个小国的 10–11 年级,三年期试点;塔尔图/斯坦福/OpenAI 的影响评估尚未发布。面向学生的爱沙尼亚语辅导应用(与 OpenAI 合作)2026 年 1 月底才开放,已激活账户中 47% 每周使用。
这一阶段能说明什么:真实场景里的小规模试验。说明落地条件正在被检验,不代表条件已经成立。
Sweetgreen 同意以 1.864 亿美元将 Infinite Kitchen 自动化配餐线的开发部门 Spyce 出售给 Wonder,并通过供应与许可协议在 20 余家自动化门店继续使用
适用范围:一家美国快休闲连锁(碗餐与沙拉):对固定菜单的装配线自动化,38 名 Spyce 员工转入买方。公司公告;此前财报电话会曾提及人工节省,本公告未给出。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Mercy 称 Microsoft Dragon Copilot 护理版已在圣路易斯、斯普林菲尔德和史密斯堡的住院病区使用,把护士口述的护理内容转为 Epic 流程表记录
适用范围:一家美国医疗系统的住院病区,早期推广;Mercy 称高频使用的护士每班省 8–24 分钟、增量加班减少 29%。Mercy 是与 Microsoft 的共同开发方,数据来自利益相关方。护士提交前需审核编辑;只涉及记录,不涉及临床决策。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
德勤同意退还一份 29 万美元(44 万澳元)澳大利亚政府报告的尾款:研究者发现虚构文献与错误归属的法院引语;德勤承认起草时使用了 Azure OpenAI
适用范围:一家四大事务所咨询业务为澳大利亚就业与劳动关系部所做的保证审查——是专业服务成果,不是记账。更正版报告 2025 年 9 月 26 日发布;退还的尾款后来被披露约为 9.7 万澳元(CFO Dive,2025 年 10 月 21 日)。关乎谁对机器起草的成果负责,不直接涉及会计任务。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
IFR《世界机器人 2025》统计 2024 年全球新装工业机器人 54.2 万台、在役 466 万台(+9%);亚洲占新装的 74%,仅中国就占 54%
适用范围:机器人制造商联合会基于成员与各国协会数据的全球行业统计。是机器人存量,不是岗位数;汽车与电子行业占新装的主体。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
METR 对 16 名资深开源开发者、246 个真实问题的随机试验发现:使用 2025 年初的 AI 工具后耗时多 19%,而他们自认为快了 20%
适用范围:熟悉大型成熟代码库的资深维护者(各约 5 年),工具主要为 Cursor Pro + Claude 3.5/3.7 Sonnet。作者明确不主张结论适用于多数开发者或新项目、初级工作。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
Crunchyroll 一部新番的德语字幕出现「ChatGPT said…」;公司称第三方供应商使用了 AI 生成字幕,违反双方协议
适用范围:娱乐字幕,一个流媒体平台、一集(《Necronomico and the Cosmic Horror Show》第 1 集,2025 年 7 月 1 日)。该公司总裁 2024 年曾称在测试生成式 AI 字幕;失误出在未经审校的供应商输出。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
Amazon 在 300 多个设施部署了第 100 万台机器人;其什里夫波特新一代履约中心在可靠性、维护与工程岗位上需要多 30% 的员工
适用范围:Amazon 全球履约网络;公司自报。机器人数量是车队规模,不是关于总人数的陈述。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
高盛在数千名员工使用后向全员开放内部工具 GS AI Assistant,用于摘要复杂文件、起草初稿与数据分析
适用范围:一家美国投行的全员通用助手,含面向银行家、研究分析师与财富管理人员的版本,由 CIO Marco Argenti 以备忘录宣布。来源为内部备忘录的报道(Reuters 首发);未涉及人数变化。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Walgreens 开设第 12 个机器人微型履约中心;该网络为 5000 多家门店每周配药超 350 万张处方,约占所支持门店处方量的 40%
适用范围:一家美国连锁药房;集中处理一部分常规处方,其余仍在门店完成。公司自报;新闻稿称释放的时间用于疫苗接种与用药依从性支持。行业媒体指出这是该连锁 2024 年秋暂停扩张后的首次新开。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
《芝加哥太阳时报》与《费城问询报》刊出一份含不存在书目的辛迪加夏日书单;撰稿人承认使用了 AI 工具,特刊未经编辑部审核
适用范围:美国报纸;由 King Features(Hearst)制作的辛迪加特刊,非编辑部自产。King Features 称已终止与该撰稿人的合作;报社 CEO 称之为审核失灵,而非采编失误。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
Klarna CEO 表示将重新招聘真人客服,称此前的 AI 优先策略中成本「占了太重的分量」、质量因此受损
适用范围:与 2024 年 2 月部署为同一家公司;AI 助手仍处理约三分之二的咨询。二手来源,转述 2025 年 5 月 8 日的 Bloomberg 采访。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
Aurora 开始在达拉斯–休斯顿之间为 Uber Freight 与 Hirschbach 提供无人在车的常规商业货运
适用范围:美国得州一条州际干线,重型卡车;枢纽到枢纽模式,首尾两段仍由人完成。宣布年底前扩展到埃尔帕索与凤凰城。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
美团配送无人机获中国民航局颁发的首张全国范围低空物流运营合格证;截至 2024 年底其无人机已在 53 条航线完成 45 万余单
适用范围:中国;航线集中在深圳、北京、上海、广州、南京。订单量只占平台总量的很小一部分;官方媒体转述公司数据。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
美国电气承包商 Rosendin 公布三机器人光伏组件安装系统的现场试验:机器人加两人小组每 8 小时班安装 350–400 块组件,并网连接仍由电工完成
适用范围:得州公用事业级光伏电站,仅组件摆放(与 ULC Technologies 合作开发);2025 年 4 月 17 日现场演示。不涉及建筑布线或住宅工程;承包商自报效率,无独立测量。
这一阶段能说明什么:真实场景里的小规模试验。说明落地条件正在被检验,不代表条件已经成立。
安永宣布首批部署 150 个 AI 代理,支持其 8 万名税务专业人员进行数据收集、文件审阅及所得税与间接税合规工作(与 NVIDIA 共建)
适用范围:一家四大会计师事务所的自有税务业务,全球范围;是启动公告,其规模数字(300 万份税务交付物、「未来一年」3000 万个流程)是前瞻目标而非已实现结果。未涉及人数。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
劳埃德银行集团宣布 2025 年 5 月至 2026 年 3 月关闭 136 家英国网点,理由是 2024 年网点访问减少 1000 万次、五年间网点交易量下降 48%;员工获提供其他岗位
适用范围:英国零售银行(Lloyds、Halifax、Bank of Scotland)。受影响员工获提供其他岗位:是网点员工工作地点与内容的变化,而非宣布裁员。
这一阶段能说明什么:招聘、人数、工时或职责出现可验证变化。权重最高 —— 但因果归因仍需论证,不能默认。
英国跨政府试验向 12 个机构的 2 万名公务员提供 Microsoft 365 Copilot 三个月;用户自报平均每天节省 26 分钟,主要在文档起草
适用范围:英国中央政府,2024 年 9 月 30 日至 12 月 31 日,自报时间节省、无对照组;安排会议约省 9 分钟、起草文档约 24 分钟。报告指出工具处理复杂数据吃力,全程需人工监督。
这一阶段能说明什么:真实场景里的小规模试验。说明落地条件正在被检验,不代表条件已经成立。
可口可乐发布由三家 AI 工作室用生成式视频模型制作的 2024 年节日广告,官方称之为「人类故事讲述者与生成式 AI 的协作」
适用范围:一个全球品牌的电视投放;AI 版本与传统制作的广告并行播出,引发创意从业者批评。发布日期 2024-11-12(据 TODAY),NBC 报道于 2024-11-18。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Alphabet CEO 在 2024 年第三季度财报电话会上表示,Google 超过四分之一的新代码由 AI 生成,再由工程师审核并接受
适用范围:一家大型科技公司的自报数据,未说明「生成」如何计量(补全还是整段函数)。未提及招聘;审核环节仍由工程师承担。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Uber 将自然语言转 SQL 工具 QueryGPT 投入运营与支持团队使用,称写一条查询从约 10 分钟降到约 3 分钟,日活约 300 人
适用范围:一家公司的有限发布;Uber 平台每月约 120 万次交互查询,此工具占比很小。原文自陈幻觉出的表/列与提示质量仍是未解问题。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
自 2024 年 8 月 1 日起生效的欧盟《人工智能法》将用于招聘或筛选人员(投放定向招聘广告、过滤申请、评估候选人)的 AI 系统列为附件三第 4 点的高风险系统
适用范围:欧盟市场。附件三义务(风险管理、人工监督、透明度)原定 2026 年 8 月 2 日起适用,可能被修订。来源为法规原文镜像;官方文本为 Regulation (EU) 2024/1689。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
Figma 在 Make Designs 提示生成界面功能上线一周后将其下线:「天气应用」生成结果与 Apple 的高度相似;CEO 归因于 QA 不足,同年 9 月重新上线
适用范围:一家设计工具厂商的生成功能(GPT-4o 与 Amazon Titan 加手工组件设计系统),限量测试版。是厂商回撤而非客户部署;三个月内以 First Draft 重新上线。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
Klarna 称 2024 年第一季度用生成式 AI 制作了 1000 余张营销图片,图片开发周期从六周缩至七天,每年图片制作成本减少 600 万美元
适用范围:一家金融科技公司的内部营销图片(工具:Midjourney、DALL-E、Firefly、Topaz Gigapixel、Photoroom)。是活动素材,不是品牌识别或定制插画;公司自报。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Klarna 2024 年第一季度营销支出减少 11% 而活动数量增加,称其中 37% 的节省(年化约 1000 万美元)来自用于图片、文案与翻译的生成式 AI
适用范围:一家金融科技公司的内部营销团队;外部代理支出下降 25%。公司自报;新闻稿未给出人数变化。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Klarna 称其 80% 的文案由内部工具「Copy Assistant」以生成式 AI 完成;2024 年第一季度 AI 贡献约 1000 万美元的年化营销成本节省
适用范围:一家全球消费金融公司的内部营销团队;公司自报,无独立审计。适用于批量营销文案,不涉及定位工作或受监管的表述。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Klarna 的 AI 助手上线首月处理 230 万次对话、占客服聊天的三分之二;解决时长从 11 分钟降到 2 分钟以内
适用范围:全球消费金融,聊天渠道,23 个市场;退款、退货、支付、争议。公司自报数据;客户仍可选择真人客服。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
Meta 报告在 Instagram 与 Facebook 的测试马拉松中部署 TestGen-LLM:被应用的类中 11.5% 得到改进,工程师将其 73% 的推荐测试用例接受进入生产
适用范围:一家公司,对既有单元测试类做改进并经构建/通过/覆盖率过滤;生成用例 75% 可构建、57% 稳定通过、25% 提升覆盖。公司自撰论文;场景是限时测试马拉松而非日常流水线。
这一阶段能说明什么:真实场景里的小规模试验。说明落地条件正在被检验,不代表条件已经成立。
新加坡建设局 2023 年 12 月 18 日软启动 CORENET X:一个协调 BIM 模型取代分别向各机构提交,约 20 个审批阶段压缩为 3 个关口,几何规则自动审查正在纳入
适用范围:仅限新加坡监管报批;2025 年 10 月 1 日起 GFA 达 30,000 m² 以上的新项目强制使用(info.corenet.gov.sg)。自动审查仅覆盖建筑、结构、机电的简单几何/空间规则;需判断的合规仍由注册专业人士负责。
这一阶段能说明什么:企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
英国超市 Booths 在 28 家门店中的 26 家撤掉自助收银、恢复人工收银,理由是机器慢、不可靠、缺乏人情味且散装商品难处理
适用范围:一家英国区域连锁(28 店);是一次回撤,不是行业常态。此后有更大的连锁也缩减了自助收银,也有的继续扩大。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
美国联邦法院因两名律师及其事务所提交引用六个 ChatGPT 编造判例的文书而处以 5,000 美元罚款,同时指出使用可靠的 AI 工具本身并无不当
适用范围:美国联邦法院(纽约南区)。确立了签字律师而非工具对机器辅助文书负责的原则;多个律师协会随后发布指引。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
美国联邦法院因两名律师及其事务所提交引用六个 ChatGPT 编造判例的文书而处以 5,000 美元罚款,同时指出使用可靠的 AI 工具本身并无不当
适用范围:美国联邦法院(纽约南区,Castel 法官)。处罚依据是未核实、且被质疑后仍坚持引用。被后续多份职业行为指引引用。
这一阶段能说明什么:失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
事件如何变成证据,以及为什么站上大部分判断仍标记为推断:方法与证据 →