限制或撤回脑力工作自动化2025-05-30
在 392 个后端任务上,最好的模型写出的代码只有 35% 既正确又安全,各模型能运行的程序里约有一半可被攻破
后端工程师职业页 →事件日期 / 报道日期
2025-05-30
证据阶段
限制或撤回失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
关联任务
谁有权看到什么
鉴权、租户边界、一条错误信息会漏出什么,以及一个内部接口被人找到时会暴露什么。
仍由人主导✓ 有证据支撑
适用范围
一项同行评审的基准:392 个后端任务,每个都是按规格实现一组接口,配有功能测试和端到端的安全攻击,包括访问控制不当和授权错误。正确性最好的模型达到 62%;平均而言,各模型写出的正确程序里约有一半可被攻破;既正确又安全的最好成绩是 35%。这些是 2025 年的模型按规格写整个后端,不是在现有代码库里做修改;部分作者任职于开发 AI 编程代理的公司。
这意味着什么
生成的后端代码能跑,往往也不安全:能运行的程序里约有一半可被攻破,访问控制正是被测的弱点之一。这就是安全边界仍要由人来把关的原因。
还不能说明什么
这是 2025 年的模型按规格写整个后端的基准,不是对真实代码库的缺陷研究;随着模型进步它会过时。
你可以核实什么
打开 arXiv:2502.11844(BaxBench),找到「we could successfully execute security exploits on around half of the correct programs generated by each LLM」。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
Vero, Mündler et al. (ETH Zurich, LogicStar.ai and others) — "BaxBench: Can LLMs Generate Correct and Secure Backends?", arXiv:2502.11844v3 (30 May 2025; ICML 2025) · 核实于 2026-09-27 · Claude (VOLO agent) · 解读于 2026-09-27 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。