算法 / 机器学习工程师 · 任务逐条
分析单位是任务,不是职位名称。下面每一条都带着它的方向、这条判断是有证据还是平台推断、判断的理由,以及它没有确立什么。
这一页上的每一项任务#
为这个问题做一个模型
正在自动化≈ 平台推断选一个结构、用你自己的数据训练它、调到指标动起来为止。
两股力量,而只有一股是这个站平时说的「自动化」。工具确实把搜索过程自动化了 —— 选结构、调超参从「做」变成了「配」。更大的那股力量性质不同:大量过去必须训点什么才能解决的问题,现在是调用一个别人训好的模型。这项任务不是变得机器可做了,是它的产物变得可以买了。
本站的四个方向词分不出这两种机制,而这个区别对任何据此页做打算的人都要紧:一件因为「可以买」而消失的工作,会在供应商的价格、许可或能力变动时重新出现,而一件「机器学会了做」的工作不会这样回来。它也没有说那些买不到的领域 —— 窄场景、私有数据、延迟受限、受监管 —— 而这些并不罕见。
决定什么才算够好
仍由人主导✓ 有证据支撑做出那套测试集、选定那个指标,并说出这东西现在能不能用在真实的人身上。
一个学出来的系统,正确性没法被定义,只能被测量 —— 所以那把尺子本身就是交付物,而它必须由知道「在这里犯错要付什么代价」的人来做。一个模型已经见过的基准什么也测不出来,所以做一套诚实的测试集是一份对抗性的工作,不是一份收集数据的工作。模型越强,这项任务越稀缺 —— 被评判的东西越难,评判本身就越难。
这是一条关于工作性质的判断,不是对「有没有人做这件事」的测量。有大量团队根本不做,直接拿供应商公布的基准就上线 —— 那正是这一条描述的失效方式,不是反证;但「那是多少家」在任何地方都没有被数过。
把数据弄成能学的样子
正在被增强≈ 平台推断采集、标注、清洗,以及决定什么不要 —— 并且察觉数据说的和世界说的不一样。
模型辅助标注与合成数据把这件事的工作量拿走了大半,而那是真的:过去要一个团队干几周的,现在常常一个下午就有初版。没能迁移过去的是「知道哪些样本从一开始就不可能被采集到」—— 而一个只能读到「在场之物」的工具,看不见缺席。
这里没有量任何一个团队在这上面花多少时间,而一个手上已有数据资产的团队和一个从零开始的团队之间,这个答案差一个数量级。用模型去标注「用来训模型的数据」本身也有已知的失效模式,而这条判断没有称量它。
当它悄悄不灵了
正在被增强≈ 平台推断漂移、上游输入变了、训练数据里从来没有过的季节性 —— 以及「重训、回滚,还是关掉」这个决定。
检测确实进步了:监控工具现在比一个盯看板的人更早、更好地把分布偏移指出来。拿它怎么办没有动,因为几个选项是在生意层面互相权衡的 —— 重训要花钱而且可能更糟,关掉今天就有看得见的代价,而什么都不做同样是一个决定。
它没有说团队到底监不监控。一个没人看管地跑了一年的模型很常见,而这条判断没有覆盖那种情况 —— 在没有人看的地方,这项任务不是「由人主导」,它只是没有被做。
手工造输入特征
正在自动化≈ 平台推断凭领域知识,手工设计模型据以学习的那些派生信号。
这一项在本站所测量的这段时期开始之前就基本结束了。表示学习在 2010 年代把视觉、语音与文本里手工设计的特征替换掉了,此后这个模式又扩展到表格与序列问题上。它仍然写在这一页上,是因为大量教材至今仍在教它 —— 于是人们带着「这就是这门手艺」的预期进来。
它完全不是关于 2022 至 2026 这个窗口的证据 —— 它比那更早,写在这里是为了让人对得上位置。在某些「不允许出现无法解释的输入」的受监管场景里,领域特征设计仍然承重,而这条判断没有把那部分单独分出来。
为它对人做了什么答复
新出现的任务✓ 有证据支撑解释系统对某个人做出的一个判定、证明输入数据配得上这个用途,并在它被质疑时成为那个具名的人。
新工作,而且它来自监管而不是来自能力:若干市场已经对用在招聘、信贷、教育与公共服务上的系统附加了义务,其中包括「部署方必须确保输入数据与用途相关且足够有代表性」这样的要求。这种形状的义务,必须落在一个懂得模型到底吃了什么的人身上。本站有一条已核实记录正是这样一条条款生效 —— 它挂在部署方那一页(业务系统负责人),因为条款点名的是那个角色。
这段推理指向的那条记录没有挂在这个职业上,而且是刻意的:那条义务点名的是部署方,把它挂在这里等于声称它落在工程师身上,而在多数组织里还没有人被告知它落在谁身上。所以这是关于「这份工作将会落在哪儿」的推断,不是「它已经落在那儿」的证据。要求也因市场、因系统用途而差异极大。