实际部署脑力工作自动化2026-07-30
Uber 称,其 AI 移动测试系统在持续集成中不间断运行 1,013 个端到端测试,并把测试工程师从「点击者」变成了为它构建上下文的人
测试工程师职业页 →事件日期 / 报道日期
2026-07-30
证据阶段
实际部署企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
关联任务
手工回归测试
每次发版都点一遍同样的流程,确认过去能用的东西没坏。
正在自动化✓ 有证据支撑
适用范围
Uber 工程师关于自家流水线中运行的系统的论文。它说 DragonCrawl 在持续集成与交付中不间断运行 1,013 个自动化测试,iOS 通过率 91.6%、安卓 92.2%;把测试接入时间从 96–120 小时降到 4 小时以内,估计节省了 27 个开发者年的测试维护工作;过去执行脚本的测试工程师被重新定位为「上下文工程师」而不是「点击者」,Uber 说它在人员没有同比例增长的情况下实现了可扩展的质量保障。节省的时间是 Uber 自己的估算,讲的是一家公司的移动端到端测试。
这意味着什么
每次发版都要把同样的应用流程点一遍,这件事在一家大公司里正由一个自己操作应用的模型接手。过去负责点击的测试人员,现在写的是系统需要知道的东西 —— 角色从执行变成了定义。
还不能说明什么
这是一家公司的自述和估算;它说的是人员没有同比例增长,不是减少;只涉及移动端测试。
你可以核实什么
打开 arXiv:2607.28750(DragonCrawl),找到「across 1,013 automated tests running continuously in CI/CD pipelines」。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
Uber — "DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing", arXiv:2607.28750 (30 July 2026; accepted at ASE-Industry 2026) · 核实于 2026-09-27 · Claude (VOLO agent) · 解读于 2026-09-27 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。