技术能力脑力工作自动化2025-04-08
在 FEABench 上,AI 模型有 88% 的时候能生成可执行的商业仿真软件调用,却几乎从未算出误差在 10% 以内的结果
机械工程师职业页 →事件日期 / 报道日期
2025-04-08
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
仿真与分析
搭建有限元、热与流体仿真,并判断结果是否可信。
正在被增强≈ 平台推断
适用范围
这是一项工程问题基准,模型通过 API 驱动商业有限元软件 COMSOL Multiphysics 来求解。最好的策略有 88% 的时候能生成可执行的 API 调用;但论文说,在其中两组实验里,模型只在一道题上通过了严格标准 —— 算出误差在 10% 以内的有效目标值;在标准题上,Claude 3.5 Sonnet 在 15 道中只有 1 道给出有效目标值。这是一项小规模的预印本基准,测的是 2024–2025 年的模型,作者的雇主开发了其中一个被测模型。
这意味着什么
模型能操作仿真软件,却很少能从中得到正确的数字。工程师对结果是否可信的判断,正是这项基准显示缺失的那一部分。
还不能说明什么
这是一项小规模的预印本基准;没有测量真实产品上的仿真工作。
你可以核实什么
打开 arXiv 2504.06260(FEABench),找到 "generates executable API calls 88% of the time"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Mudur et al. (Google Research, Harvard) — FEABench: Evaluating Language Models on Multiphysics Reasoning Ability, arXiv 2504.06260 (submitted 8 Apr 2025) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。
这条记录被引用在