这个职业有新的已核实记录时通知我 → · 标出哪些任务是你的(VOLO Pro,发布期间免费)→
数据科学家
把一个业务或研究问题变成数据能回答的问题:界定它,清洗和探索数据,建立并验证统计或预测模型,设计和解读实验,并向决策者说明结果说明了什么、没说明什么。AI 智能体如今能写出大部分分析代码,但在公开基准上,最好的也只能解决约三分之一贴近现实的数据分析任务,在因果问题上最吃力。银行监管者仍期望模型由独立的人来质询,美国的预测则认为数据科学岗位会增长。
拿你最近做的一项分析,写下它说明的是因果还是仅仅相关,以及什么样的实验能把它定下来。
这不是失业概率。它把「岗位任务中有多少暴露于自动化」与「采用实际走到了哪一步」合成为一个值 —— 只用于在同一套口径下横向比较职业,除此之外不作他用。
适用于为决策建模、做实验的数据科学家 —— 在科技公司、银行和保险公司、研究机构与公共部门。主要用 SQL 和仪表盘工作的分析师有自己的一页,在生产环境中构建和运行学习系统的工程师也是。证据是 AI 智能体在数据科学任务上的基准测试、银行监管者关于模型风险的指引、关于审计自动化决策的规则,以及美国的劳动力预测;它们确立的是智能体在测试任务上能做什么、规则期望人做什么,不是数据科学家的时间怎样变化。
到底什么在变#
分析单位是任务,不是职位名称。职业不会被整体替代 —— 变的是它的任务构成。
每一格是一项任务。大小是它在这份工作里的分量,颜色是它正在往哪个方向走。点一格,看这个判断还不能说明什么。
基准任务不是某家公司的数据,欧盟对高风险系统的义务也要更晚才适用;这里没有任何东西测量花在清洗上的时间。
基准过时得快,测的是短任务;说明不了真实项目中模型怎样建立,也说明不了智能体现在做了多少。
这就是你做的吗?认一下,这一页会缩到只剩与你有关的那一份。
职位名只是一组恰好被打包买走的任务,而没有两个人手里的那一组是一样的。什么都不会被发送出去 —— 它只留在这个浏览器里。
近期变化#
美国。劳工统计局的职业展望预测,2025 至 2035 年数据科学家就业将增长 35%,远快于所有职业的平均水平,十年间平均每年约有 24,800 个职位空缺。这是针对一个国家、在企业把 AI 系统引入工作之际作出的预测;它数的是岗位,不是这些岗位包含哪些任务。
一个有资格的人,在具名、有日期、可归属的公开表态里,对未来做出了一个判断。记录它,是为了让「谁在什么时候说了什么」保持可核对 —— 而它永远不改变任务判断,因为预测不是观察。它的价值在之后才到:这条记录和那个职业的证据同在一页,读到预测的人,旁边就是「后来发生了什么」的记录。那就是结算;本站不对一条预测是否应验发布结论。
美国。银行监管机构修订的模型风险指引取代了 2011 年的 SR 11-7。它写明:有效质询由具备进行批判性、客观质询所需专业能力、足以保持客观的独立性,以及足以推动改变的组织地位与影响力的个人来进行;生成式 AI 与智能体 AI 模型不在其范围之内;这份指引不设可强制执行的标准,不遵守也不会招致监管批评。它主要针对总资产超过 300 亿美元的银行机构。
失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
这是一项学术基准,由需要智能体处理真实数据并写代码(包括整理与分析)的数据科学编码任务组成。它报告:使用其基线智能体,当时最好的语言模型准确率只有 30.5%,仍有很大的提升空间。它测的是 2024 年的模型在设计好的任务上的表现。
演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
这是一项基准,包含取自 Eloquence 与 Kaggle 竞赛的 466 项数据分析任务和 74 项数据建模任务,用来测试基于 GPT-4o、Claude、Gemini 等模型的 AI 智能体。它报告:最好的智能体只解决了 34.12% 的数据分析任务,在建模任务上的相对性能差距为 34.74%。它测的是 2024–2025 年可用的模型在竞赛任务上的表现,不是在某家公司数据上的工作;作者之一的雇主在开发 AI 模型。
演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
欧盟。《人工智能法》第 10 条规定,高风险 AI 系统的训练、验证和测试数据集应当遵循数据治理与管理做法,包括标注、打标签、清洗等数据准备,以及针对可能偏差的检查;第 14 条规定,高风险系统应当被设计为能被自然人有效监督。这些义务约束高风险系统的提供者;根据 2026 年的修订条例,附件三所列系统的高风险义务自 2027 年 12 月 2 日起适用。
失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
这是一项学术基准,包含 411 个附带数据表的问题,取自教材、在线学习资料和学术论文,测试统计与因果推理。它报告:最强的模型 GPT-4 准确率为 58%;模型在数据分析和因果推理上有困难,难以同时运用因果知识与给定的数据。它测的是 2024 年的模型在教材式问题上的表现,不是真实产品上的实验。
演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
纽约市。落实该市自动化招聘决策工具法的最终规则写明:若距该工具最近一次偏差审计已超过一年,雇主或职业介绍机构不得使用或继续使用它;偏差审计至少必须计算每个类别的录取率和影响比;若审计方曾经或正在参与使用、开发或分发该工具,就不算独立。它涵盖的工具包括机器学习、统计建模和数据分析。它适用于一个城市的招聘与晋升。
监管、补贴或公共采购正在要求或出资推动采用 —— 与「限制或撤回」互为镜像。它说明采用正在被要求,不说明采用已经发生,所以单独一条永远不够,两条互不相干的才够。
这对你意味着什么#
如果你刚入行,AI 智能体最擅长的那部分工作 —— 写常规的分析和建模代码 —— 恰恰是初级岗位过去赖以建立的部分。把你的价值建在证据显示智能体最弱的地方:界定问题、设计实验与因果推理,以及把结果讲给必须做决定的人。
预期你审查和指挥生成代码的时间会多于亲手写代码,也预期随着关于自动化决策的规则扩展,更多时间会花在验证、记录和审计上。你质询一个模型、并在你说「它到这里为止」时被相信的那种地位,正是这些规则围绕的部分。
你的选择#
四个方向,每个都写明真实约束和一个本周可验证的动作。继续做下去也是正当选择 —— 只要它是被选择的,而不是被默认的。
继续做数据科学家,向实验与因果工作靠拢
因果推理与实验设计是基准显示模型最吃力的地方,而决策依赖它们。
实验类岗位主要集中在大型产品公司和研究机构;小公司可能没有足够多的测试需要这样的人。
拿你最近做的一项分析,写下它说明的是因果还是仅仅相关,以及什么样的实验能把它定下来。
承担模型验证与审计
银行监管者期望对模型进行独立质询,纽约市要求对招聘工具做独立的偏差审计;这项工作需要懂模型、而又不是模型构建者的人。
独立意味着不能审计自己团队的模型,可能要换团队或换雇主;银行指引并无约束力。
查清你所在机构有没有模型验证或模型风险部门,以及它在模型上线前检查什么。
转向决策支持:产品或政策分析
在这里的证据中,向做决定的人解释结果意味着什么,是这份工作里最少被自动化触及的部分。
这些岗位看重领域知识与沟通,多于技术深度,薪酬也可能不同。
问一位与你共事的决策者,你最近的哪些结果改变了一个决定,以及为什么。
常见问题#
就现有证据看,不会。AI 智能体能写出大部分分析代码,但在公开基准上,最好的也只能解决约三分之一贴近现实的数据分析任务,在因果推理上最弱。关于模型的规则期望由独立的人来质询和审计,美国的预测也认为数据科学家岗位会增长。变化的是结构:手写代码更少,界定、检查和解释更多。
我们不用年数回答这个问题。你可以看一个信号:AI 智能体是否开始在因果与实验类问题的基准上追平人,以及关于模型的规则是否不再要求由独立的人来质询。前者今天并不成立;后者与当前的方向相反。
在 DSBench(取自真实竞赛的 466 项数据分析与 74 项数据建模任务)上,最好的智能体解决了约 34% 的分析任务;在 DA-Code 上,最好的模型准确率约 30.5%;在统计与因果问题基准 QRData 上,最强的模型达到 58%。基准过时得快,但它们显示了智能体最强和最吃力的地方。
美国的预测认为,2025 至 2035 年数据科学家的就业将增长 35%,远快于平均水平。工作正在向界定问题、设计实验、验证与审计模型和解释结果转移 —— 这些正是智能体最弱、规则也期望由人来做的部分。
这些判断底下是什么#
这一页上 6 条任务判断里,2 条有已核实事件支撑、4 条是平台推断,每一条都在它出现的地方标注着。它们底下是 2 个技术维度、一条自语言模型进入公众视野以来的回溯轨迹,以及 7 条已核实事件。
同一个职能里的其他岗位#
一家公司先把工作分成职能,再分成岗位。下面这些和这一份工作同在「技术与数据」里 —— 那是一件关于组织结构的事实,不是「它们相似」或者「它们在朝同一个方向变」的判断。
初级程序员 · 中高级软件工程师 · 前端工程师 · 后端工程师 · 数据工程师 · 算法 / 机器学习工程师 · AI 研究员 · 测试工程师 · 数据分析师 · 业务分析师 · 业务系统与流程负责人 · IT 支持 / 技术支持 · 网络安全分析师 / 安全运营 · 运维 / 平台工程师 / SRE · 网络工程师 · 技术文档工程师 / 技术写作
