技术能力脑力工作自动化2024-04-27
在需求已经明确的前提下,GPT-4 起草的软件需求规格说明达到初级工程师的质量,用时只需七分之一到四十七分之一
业务分析师职业页 →事件日期 / 报道日期
2024-04-27
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
编写需求与用户故事
把了解到的东西写成开发和测试可以据以工作的需求文档、规格说明和用户故事。
正在被增强✓ 有证据支撑
适用范围
这项研究比较 GPT-4、CodeLlama 与人工基准,为一个大学学生社团管理门户起草需求规格说明,按八项标准评分。它报告:模型能达到初级软件工程师的产出质量;在需求已经明确之后,人工文档用了 4 到 24 小时,模型草稿用时少 7 到 47 倍,但第一次很难写对。需求是给定的,不是挖掘出来的。
这意味着什么
一旦有人弄清了需要什么,写规格说明对模型来说就是很快的活。耗时、有价值的部分,是弄清需要什么 —— 而这项研究把这一步现成地交给了模型。
还不能说明什么
这是一个需求事先给定的大学项目;不是对真实项目的测量。
你可以核实什么
打开 arXiv 2404.17842,找到 "match the output quality of an entry-level software engineer"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Krishna et al. (IIIT Delhi, Wadhwani AI) — Using LLMs in Software Requirements Specifications: An Empirical Evaluation, arXiv 2404.17842 (submitted 27 Apr 2024) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。