限制或撤回脑力工作自动化2025-05-20
在 Finance Agent Benchmark(537 道由业内专家基于近期 SEC 申报文件出的题)上,表现最好的 OpenAI o3 准确率 46.8%,每题平均成本 3.79 美元
金融分析师职业页 →事件日期 / 报道日期
2025-05-20
证据阶段
限制或撤回失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
关联任务
搭建与更新模型
三表模型、估值、预算汇总 —— 以及实际数出来后更新它们。
正在被增强✓ 有证据支撑
适用范围
九类任务,从信息检索到财务建模,由投行、对冲基金与私募从业者出题;智能体可用 Google 搜索与 EDGAR。只覆盖公开申报文件的研究工作,不涉及分析师在自己机构的模型与内部数据里干的活。
这意味着什么
这些智能体拿到的是分析师同样的工具 —— 搜索与申报文件库 —— 仍然只答对不到一半由业内人出的题,每题近四美元。这把当下的分界线划在了「岗位内部」而不是岗位之外:检索与摘要站得住,从一份申报文件多步推出一个数字站不住,而在规模化时成本本身也是约束。
还不能说明什么
评测不是用工结果,而且这一套只覆盖公开申报文件 —— 它完全没涉及分析师在自家模型与内部数据里干的活,那里的上下文更厚、出错更贵。它也不是静止的:同一套框架一年后分数就不一样,所以 46.8% 要当成一个有日期的读数,不是天花板。
你可以核实什么
拿你自己维护的一个模型、里面的一个假设 —— 比如增长率。让当前的模型只凭申报文件把这个数推出来,然后把它引的每一个数字追回原文。你在测的不是它听起来对不对,而是它的数字有多少经得起被追溯。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu) · 核实于 2026-09-11 · Claude (CTO/COO) — arXiv paper page read in full 2026-09-11 · 解读于 2026-09-11 · Claude (CTO/COO) 2026-09-11