技术能力脑力工作自动化2024-10-09
OpenAI 用 75 场 Kaggle 竞赛搭了一个考机器学习工程的基准,表现最好的组合在其中 16.9% 拿到了铜牌水平
算法 / 机器学习工程师职业页 →事件日期 / 报道日期
2024-10-09
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
为这个问题做一个模型
选一个结构、用你自己的数据训练它、调到指标动起来为止。
正在自动化≈ 平台推断
决定什么才算够好
做出那套测试集、选定那个指标,并说出这东西现在能不能用在真实的人身上。
仍由人主导≈ 平台推断
适用范围
七十五场机器学习工程类的 Kaggle 竞赛 —— 训练模型、准备数据、跑实验 —— 以每场竞赛自己的公开排行榜作为人类基线来评分,也就是说对照的是真的下场比过的人。写作时表现最好的组合(o1-preview 配 AIDE 脚手架)在 16.9% 的竞赛里达到至少铜牌;作者同时报告,算力投入与预训练数据污染都会改变这个数字,而基准是开源的,任何人都可以拿更新的模型重跑。有两条限制是结构性的,不是偶然的:一场 Kaggle 竞赛送到手上时,问题已经被框定、指标已经被选定、数据已经被收集 —— 而那恰恰是这份工作里基准完全考不到的部分;以及,OpenAI 建了这个基准,并出售被它测量的模型。
这意味着什么
这份工作里最像一场比赛的那一部分,现在有了公开、可重跑的测量:问题已框定、指标已选定、数据已备好,还有一排真的下场比过的人可以输给他们。在这一部分上,2024 年底智能体大约每六场里有一场达到铜牌水平;而基准是开源的,所以这个数字会在公开场合变动,而不是在某家厂商的幻灯片里变动。
还不能说明什么
在竞赛里拿铜牌不等于有一个模型上了生产,而基准看不见决定「能不能上生产」的那些步骤:是谁把问题框成这样的、为什么选这个指标而不是另一个、训练数据是否允许这样用,以及分布漂移的那一天会发生什么。这个数字也没有说任何关于招聘的事。要连日期一起读 —— 它测的是某一代模型,而作者自己就提醒:预训练数据污染会让这个数字动。
你可以核实什么
翻出你上一个上线的模型,写下是谁选定了考核它的那个指标。如果那个人是你,那么这个基准考的那部分,并不是你被付钱的那部分。如果是别人,值得去问一句他是怎么选的。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 2 项关联判断维持原状。
来源
MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering (OpenAI, arXiv:2410.07095) · 核实于 2026-09-12 · Claude (VOLO agent) — arXiv abstract page read; the 75-competition count, the 16.9% bronze figure and the AIDE/o1-preview pairing taken from the authors' own abstract · 解读于 2026-09-12 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。