技术能力脑力工作自动化2024-10-09
在以智能体完成数据科学编码任务的 DA-Code 基准上,最好的语言模型准确率只有 30.5%
数据科学家职业页 →事件日期 / 报道日期
2024-10-09
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
建立并验证模型
选定方法,拟合与调参,并检查它在没见过的数据上是否站得住。
正在被增强≈ 平台推断
适用范围
这是一项学术基准,由需要智能体处理真实数据并写代码(包括整理与分析)的数据科学编码任务组成。它报告:使用其基线智能体,当时最好的语言模型准确率只有 30.5%,仍有很大的提升空间。它测的是 2024 年的模型在设计好的任务上的表现。
这意味着什么
写数据科学代码是智能体最有能力的地方,而在这个基准上它们仍然做错了大多数任务。数据科学家的角色正转向指挥和检查生成的代码。
还不能说明什么
这是 2024 年、基于设计任务的基准;更新的模型可能得分更高,它也没有测量真实项目。
你可以核实什么
打开 arXiv 2410.07331(DA-Code),找到 "achieves only 30.5% accuracy"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Huang et al. — DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models, arXiv 2410.07331 (submitted 9 Oct 2024; EMNLP 2024) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。