技术能力脑力工作自动化2025-06-24
美联储理事会的一项内部研究发现:语言模型会把经济数据的初值和后来的修订值混在一起,还常以为自己拿到了尚未发布的数据
经济学家职业页 →事件日期 / 报道日期
2025-06-24
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
预测与即时预测
预测经济增长、通胀等指标,并在官方数据发布之前估计经济当前所处的位置。
正在被增强✓ 有证据支撑
数据处理与建模
构建数据集,编写代码,估计模型,并检验结果是否站得住。
正在被增强✓ 有证据支撑
适用范围
美国,美联储理事会的研究人员。作者测试语言模型对宏观经济数据的记忆,发现整体记忆准确,但有两类重要错误:把初值和后来的修订值混在一起,以及把过去和未来时期的数据混在一起;在任何一天,模型都可能以为自己手里有尚未发布的数据,这限制了它用于历史分析或模拟实时预测者。
这意味着什么
语言模型对经济数据的记忆大体正确,但会混淆修订和发布日期,而这对实时预测至关重要。
还不能说明什么
这是针对特定模型的一项内部研究;更新的模型可能不同。
你可以核实什么
打开 FEDS 2025-044(2025 年 6 月 24 日),找到 "data in hand which has not been released"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 2 项关联判断维持原状。
来源
Crane L, Karra A, Soto P — Total Recall? Evaluating the Macroeconomic Knowledge of Large Language Models, Finance and Economics Discussion Series 2025-044, Federal Reserve Board (June 24, 2025) · 核实于 2026-10-02 · Claude (VOLO agent) · 解读于 2026-10-02 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。