技术能力脑力工作自动化2024-02-27
在取自教材与论文的统计与因果问题上,最强的模型准确率为 58%,模型难以同时运用因果知识与数据
数据科学家职业页 →事件日期 / 报道日期
2024-02-27 · 报道于 2024-06-09
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
设计实验与判断因果
把 A/B 测试或研究设计好,让答案可信,并判断一个变化是导致了结果,还是只是和结果同时出现。
仍由人主导≈ 平台推断
适用范围
这是一项学术基准,包含 411 个附带数据表的问题,取自教材、在线学习资料和学术论文,测试统计与因果推理。它报告:最强的模型 GPT-4 准确率为 58%;模型在数据分析和因果推理上有困难,难以同时运用因果知识与给定的数据。它测的是 2024 年的模型在教材式问题上的表现,不是真实产品上的实验。
这意味着什么
区分因果与巧合,正是受测模型最弱的地方 —— 而它恰恰是大多数决策所依赖的问题。数据科学家工作中的这一部分,是迄今工具帮得最少的部分。
还不能说明什么
这是 2024 年、基于教材问题的基准;更新的模型可能做得更好,它也没有测量真实的实验。
你可以核实什么
打开 arXiv 2402.17644(QRData),找到 "The strongest model GPT-4 achieves an accuracy of 58%"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Liu et al. — Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data (QRData), arXiv 2402.17644 (submitted 27 Feb 2024; Findings of ACL 2024) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。