数据科学家 · 任务逐条
分析单位是任务,不是职位名称。下面每一条都带着它的方向、这条判断是有证据还是平台推断、判断的理由,以及它没有确立什么。
这一页上的每一项任务#
界定问题与指标
仍由人主导≈ 平台推断弄清决策者真正需要知道什么,以及哪个可测量的量能回答它、又不会奖励错误的东西。
这件事的输入是和一群还不知道该问什么的人对话,风险是一个容易推动、却不该被优化的指标。O*NET 为这个职业新提出的候选任务,是访谈利益相关方、找出数据分析应当回答的问题 —— 这是正在被加进来的工作,不是被拿走的。
这依据的是工作的性质和 O*NET 的候选任务清单;这里没有记录测量问题是怎样界定的、由谁来界定。
清洗与探索数据
正在被增强✓ 有证据支撑找出数据哪里不对,决定修什么、剔除什么,并弄清它能说明什么、不能说明什么。
AI 智能体能写出整理数据的代码,但在一项贴近现实的数据分析任务基准上,最好的智能体也只解决了约三分之一。对于高风险模型,欧盟《人工智能法》把数据工作本身变成一项有记录的义务:训练、验证和测试数据必须遵循涵盖清洗与偏差检查的数据治理做法。
基准任务不是某家公司的数据,欧盟对高风险系统的义务也要更晚才适用;这里没有任何东西测量花在清洗上的时间。
建立并验证模型
正在被增强≈ 平台推断选定方法,拟合与调参,并检查它在没见过的数据上是否站得住。
这是 AI 智能体最有能力、却仍明显不足的地方:在公开基准上,最好的智能体大约只能解决三分之一的数据分析任务,在数据科学编码任务上准确率约 30%。数据科学家越来越多地是在指挥和检查生成的代码,而不是全部自己写。
基准过时得快,测的是短任务;说明不了真实项目中模型怎样建立,也说明不了智能体现在做了多少。
设计实验与判断因果
仍由人主导≈ 平台推断把 A/B 测试或研究设计好,让答案可信,并判断一个变化是导致了结果,还是只是和结果同时出现。
在这里的证据中,因果推理是模型最弱的地方:在一项取自教材和论文的统计与因果问题基准上,最强的模型准确率为 58%,作者发现模型难以同时运用因果知识和给定的数据。
基准测的是 2024 年的模型、教材式的问题;更新的模型可能做得更好,它也没有测量真实产品上的实验。
说清它意味着什么、不意味着什么
仍由人主导≈ 平台推断把结果讲给做决定的人,让他们明白其中的不确定性、前提假设,以及什么情况会改变答案。
一个决定取决于是否信任那个说清数字意味着什么、在哪里止步的人。美国劳动力预测认为,随着各机构把 AI 系统引入工作,2025 至 2035 年数据科学家的就业将增长 35%,远快于平均水平。
预测不是结果;它数的是岗位,不是这些岗位包含哪些任务。
质询与审计模型
新出现的任务✓ 有证据支撑独立检验别人的模型 —— 它是否有效、在哪里失效、是否不公平地对待某些群体 —— 并为监管者或审计方留下记录。
围绕模型的规则是写给人的:美国银行监管者期望由具备专业能力、独立性和足以改变模型的地位的人来进行有效质询,并暂时把生成式与智能体 AI 排除在这份指引之外;纽约市规定,自动化招聘工具若在过去一年内没有做过偏差审计,就不得使用,且审计方必须独立于该工具。
银行指引不具强制力,针对的是大型银行;纽约的规则只涉及一个城市的招聘工具。两者都没有测量有多少人在做这项工作。