数据工程师
把数据从「它发生的地方」搬到「有人问起它的地方」,并且是最先发现这两边对不上的那个人。
这不是失业概率。它把「岗位任务中有多少暴露于自动化」与「采用实际走到了哪一步」合成为一个值 —— 只用于在同一套口径下横向比较职业,除此之外不作他用。
适用于搭建并运行数据管道、数仓,以及它们之上那层模型的工程师。查询结果的那批人在「数据分析师」页;机器学习工程是另一份工作,本站还没有覆盖。这一页还的是一张欠条 —— 分析师那一页的适用范围里一直写着「数据工程师情况不同」。
证据库里已有其他职业的已核实记录,但这个职业还一条都没有。在有之前,下面的分析是对任务结构与已知技术能力的推理 —— 就这个职业而言,它没有可追溯来源支撑。我们宁可直说,也不引用未经核实的东西。这里是空的,是我们覆盖上的缺口,不是关于这份工作的结论。
到底什么在变#
分析单位是任务,不是职位名称。职业不会被整体替代 —— 变的是它的任务构成。
把管道搭起来
正在自动化≈ 平台推断从一个源头抽出来、把形状改对、装进一个能查询的地方,并给整件事排上调度。
连接常见数据源的接头现在是买的,不是写的;而变换代码的规格清晰到生成完全应付得来。这类工作在不同公司之间重复了二十年 —— 那正是让一项任务变便宜的条件。
管道在跑,不等于数字是对的。在一个成熟的数据团队里,时间从来不是花在「把它搭起来」上,而是花在「让它保持真实」上。
数据错了,但什么都没报错
仍由人主导≈ 平台推断上游某个字段的含义变了、某个任务跑了两遍、时区偏了 —— 而所有看板依然是绿的。
「无声地错了」是这份工作的标志性失效模式,而它不是一个「更好的工具就能解决」的检测问题 —— 它要求你知道这个数字对这门生意本来应该意味着什么,而那长在人身上,不长在表结构里。测试只能抓住你想到要测的东西。
这是一条关于失效性质的判断,不是对它发生频率的测量。我们没有任何「团队量化过无声数据错误」的记录 —— 一部分原因是,按定义它们要么被很晚发现,要么根本没被发现。
为「一个数字是什么意思」负责
仍由人主导≈ 平台推断定义什么算活跃用户、什么算收入、什么算流失 —— 并在两个团队希望它有不同含义时守住这个定义。
自然语言转 SQL 的工具让查询变便宜,反而让「定义」更承重而不是更轻:一旦任何人都能问,答案就完全取决于模型捡起了哪一个定义。分析师那一页的证据指向同一处 —— 在一个用真实企业数仓构建的基准上,纯模型得分为零,而它在公开基准上是 80 到 90 分;这个落差在于表结构与语义,不在于 SQL。
那个基准讲的是查询,不是「定义归谁管」,而且它的作者在卖一套替代系统 —— 分析师页上的那条记录写明了这一点。它确立的是「企业表结构会打败当前的模型」;它没有确立「有人正在为维护语义而被招聘」。
「一直问下去」要花多少钱
正在被增强≈ 平台推断分区、存储分层、某人排了每小时一次却全表扫描的那条查询,以及月底那张账单。
数仓现在会自己把那条昂贵的查询指出来并建议怎么改 —— 这是实打实的帮助。剩下的是「这个答案值不值这笔钱」的决定,而那需要你知道谁在用这个数字、用它来做什么。
它没有说整体成本是在涨还是在跌;而查询变便宜往往会让被问出来的问题变多 —— 这可能把账单推向任意一个方向。
哪些必须留、必须删、或者根本不该收
仍由人主导≈ 平台推断留存期限、删除请求、个人数据被允许待在哪里,以及你能不能证明这一点。
这是一条在管道里实现的法律义务,而法律义务是挂在人身上的,不是挂在系统上的。工具可以在有人定下规则之后去执行它;而「定下它」以及「事后能证明合规」,是留下来的那一部分。
要求因市场与数据类型而差异极大,而这一页没有任何「针对数据团队执法」的已核实记录。
喂饱那些用句子回答的系统
新出现的任务≈ 平台推断把对的文档、对的新鲜度、对的访问规则,送进 AI 功能所读取的那个东西里。
检索质量现在是一个披着 AI 外衣的数据问题,而它落在这里,是因为它讲的是管道、权限与新鲜度,不是模型。在生成式功能进入产品之前,这不是一份工作。
新工作出现不等于新增编制。在多数公司里,这件事是被「本来就管着数仓的那个人」顺手接过去的,而这里没有任何东西说明相反的情况。
哪些技术在起作用#
四类独立信号。它们刻意不做加总 —— 一个职业暴露于两种技术,不等于风险翻倍。
它是怎么走到这里的#
指数不是一个静态数字。这是自 ChatGPT 以来,每个能力检查点上它大致会落在哪里 —— 回溯重建,并且如实标注。
三个工程层里起点最高的一条,因为这份工作在生成式工具出现之前就已经在被商品化了 —— 买来的连接器与托管数仓吃掉「搭建」那一半已经很多年。中段的上行,是变换代码变得容易起草、以及自然语言查询到来。它最早走平,并且 2025 年之后完全不再上行,原因就写在页面上:查询变便宜,让「定义」更承重而不是更轻。我们手上那个用真实企业数仓构建的基准,给纯模型打了零分,而公开基准上是 80 到 90 —— 落差在于含义,而含义长在人身上。
曲线平缓不是「安全」的预测。它只是在说:到目前为止,自动化触及了哪些任务 —— 这里动得最少的职业,约束都是物理的或监管的,而这两样都会变。
近期变化#
暂无已核实事件。
这一栏会随着监测流水线采集、去重、分级并关联到上面的任务而逐步填充。这里是空的,意味着我们没有核实到任何东西 —— 不意味着什么都没发生。
「没搜到新闻」不等于「安全」。
这对你意味着什么#
搭管道 —— 教程教的那件事,也是你会被招进来做的那件事 —— 是暴露的那一半。撑得住的是「知道一个数字本来应该是什么意思」,而这只能通过靠近用它的那些人来学。一份离业务很远的数据工作,是这个岗位里风险更高的那个版本。
查询变便宜,抬高了「谁为定义负责」的价值,压低了「只搬运数据」的价值。如果你一周主要在接数据源和排调度,那是暴露的那种配置;如果主要在争论「什么才算一个客户」,那是耐久的那种。
你的选择#
四个方向,每个都写明真实约束和一个本周可验证的动作。继续做下去也是正当选择 —— 只要它是被选择的,而不是被默认的。
守住语义,不是守住管子
当任何人都能用话问出一个问题,答案就取决于工具捡起了谁的定义。成为决定那件事的人,是耐久的位置。
这既是技术工作也是政治工作 —— 定义之所以有争议,是因为不同团队是按它被考核的。
挑公司看板上的一个指标,分别问两个团队它是什么意思。如果答案不一样,你就找到了这份工作。
把检索那一层接过来
公司里每一个 AI 功能最终都会变成三个问题:读哪些文档、多新、谁有权看 —— 那就是这份工作换了个名字。
它目前不光鲜,而且常常没人负责 —— 你可能要在有人给它拨预算之前先把它认下来。
在你们公司找一个 AI 功能,追一下它到底从哪里读数据。检查它的权限和源系统的权限是否一致。
往决策那一侧走
分析工程与产品分析坐在数仓和「据此行动的人」之间,而这套推理可以直接迁移过去。
要求你愿意在公开场合就「一个数字是什么意思」这件事出错 —— 那和在管道里出错是不同性质的暴露。
挑一个你产出的数字,去查上个季度到底有哪个决定是因为它而做出的。有时候答案是:一个也没有。
常见问题#
逐项去问,因为它们不是一起动的。搭管道与排调度是暴露的那部分,而且早在生成式工具之前就一直在变便宜。而「察觉到一个数字悄悄不再是它原来的意思」完全没有动,因为那份知识关于生意,不关于数据。一个你自己能核对的信号:上个季度某个数字出错时,是谁发现的、怎么发现的。
本站的证据指向相反的方向,而且很具体。在一个用真实企业数仓查询日志构建的基准上,纯模型得分为零、智能体方案约 10%,而同一类模型在公开基准上是 80 到 90 分。这个落差不在 SQL —— 在于动辄上千张表的表结构,以及长在表结构之外的含义。查询变便宜,抬高的是「维护那份含义的人」的价值。
取决于你会做哪一半 —— 而这件事值得在转过去之前问清楚。主要是接数据源和排调度的岗位,处在暴露的那一半,而且已经商品化很多年了。靠近业务、需要你就定义去争论的岗位,是耐久的那一半。两种情况的职位名称是一样的,所以在面试时问一句:最近三次争论是关于什么的。
这门生意到底怎么赚钱 —— 细到足以让你在某个数字与它不再自洽时察觉出来。工具每几年换一次,而每一种都能在几周内学会;而「看着一张看板说出『这不可能对』」的能力,才是区分留下来的人的东西。它恰好也是一个读你表结构的模型做不到的事。
方法与来源#
- 评估日期
- 2026-09-12
- 任务判断的依据构成
- 0 条有证据支撑 · 6 条平台推断 · 0 条证据不足
- 已核实事件
- 0