技术能力脑力工作自动化2024-09-12
在取自真实竞赛、含 466 项分析和 74 项建模任务的 DSBench 基准上,最好的 AI 智能体只解决了 34.12% 的数据分析任务
数据科学家职业页 →事件日期 / 报道日期
2024-09-12
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
清洗与探索数据
找出数据哪里不对,决定修什么、剔除什么,并弄清它能说明什么、不能说明什么。
正在被增强✓ 有证据支撑
建立并验证模型
选定方法,拟合与调参,并检查它在没见过的数据上是否站得住。
正在被增强≈ 平台推断
适用范围
这是一项基准,包含取自 Eloquence 与 Kaggle 竞赛的 466 项数据分析任务和 74 项数据建模任务,用来测试基于 GPT-4o、Claude、Gemini 等模型的 AI 智能体。它报告:最好的智能体只解决了 34.12% 的数据分析任务,在建模任务上的相对性能差距为 34.74%。它测的是 2024–2025 年可用的模型在竞赛任务上的表现,不是在某家公司数据上的工作;作者之一的雇主在开发 AI 模型。
这意味着什么
智能体能独立完成一部分分析,但在贴近现实的任务上,最好的也只做对约三分之一。这项工作是在被辅助,而检查智能体产出的东西,仍由数据科学家来做。
还不能说明什么
这是竞赛任务的基准,过时得快;没有测量真实项目,也没有测量智能体现在做了多少工作。
你可以核实什么
打开 arXiv 2409.07703(DSBench),找到 "the best agent solving only 34.12% of data analysis tasks"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 2 项关联判断维持原状。
来源
Jing et al. (UT Dallas, Tencent AI Lab, USC) — DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?, arXiv 2409.07703 (submitted 12 Sep 2024; revised 11 Apr 2025) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。