实际部署脑力工作自动化2025-12-31
在字节跳动为期九个月的生产部署中,一个大模型工具生成了 3,196 个接口回归测试用例,85.4% 的代码被采用
测试工程师职业页 →事件日期 / 报道日期
2025-12-31 · 报道于 2026-07-27
证据阶段
实际部署企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
关联任务
编写测试用例与自动化脚本
把需求变成用例,把用例变成在流水线里跑的脚本。
正在自动化✓ 有证据支撑
适用范围
高校与字节跳动作者关于一家大型消费互联网公司所部署工具的同行评审经验论文。它说,跨服务业务流程的接口回归测试仍主要由质量保障工程师编写和维护;在自 2025 年 3 月起为期九个月的生产部署中,这个工具生成了 3,196 个测试用例,代码总体采用率 85.4%。采用率因业务线差异很大;工具由作者开发,采用率也由他们自己测量。
这意味着什么
第二家大公司报告,机器起草的回归测试大规模被采纳进代码库 —— 起点正是它自己的论文说仍由质量保障工程师手工完成的工作。起草用例正在转给工具;工程师负责审阅和维护。
还不能说明什么
这是一家公司的工具,由开发者自己测量;它说明不了质量保障工程师变少。
你可以核实什么
打开 arXiv:2607.24000,找到「In a 9-month production deployment starting in March 2025, NL2Test generated 3,196 test cases」。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
You, Dong, Wang, Li, Peng (Fudan University and ByteDance) — "Industrial Practice of LLM-Based Test Case Carving and Assertion Generation (Experience Paper)", arXiv:2607.24000 (27 July 2026; ISSTA 2026) · 核实于 2026-09-27 · Claude (VOLO agent) · 解读于 2026-09-27 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。