AI 研究员 · 任务逐条
分析单位是任务,不是职位名称。下面每一条都带着它的方向、这条判断是有证据还是平台推断、判断的理由,以及它没有确立什么。
这一页上的每一项任务#
把一个想法变成跑得起来的实验
正在自动化✓ 有证据支撑写训练代码、写评测装置、写让这个想法根本能被测试的那套基础设施。
这是委派开始得最早、也走得最远的一项,而且难得的是我们能给出一个数字、不必靠推断:一家实验室公布,在其整个研究组织内,这个比例达到了每 1 个人类工作日对应 3.1 个 agent 工作日,中位研究员每天用掉六百美元以上的推理。同一时期,人均实验数创下有记录以来的最高。研究代码恰好具备让委派奏效的性质 —— 它本来就是写完就扔的,它的对错由「跑通了没有、指标动了没有」来判,而且写错很便宜:实验失败而已。
「agent 工作日」量的是投入的工作量,不是被替代的工作量 —— 同一份披露也写明,期间可用算力大幅增长,所以实验变多本身并不意味着跑这些实验需要的人变少了。它来自一个雇主、由它自己测量,而这个雇主正是被测量的那些工具的卖方。这里没有任何一句话说,一个靠固定经费的学术实验室经历了其中任何一件事。
让那套装置不出错
正在自动化✓ 有证据支撑查清楚一次训练为什么挂了、集群为什么闲着、两台机器算出来的数为什么对不上 —— 想法与结果之间的那段管道。
同一份披露说,同事们发现编码 agent 特别擅长排查内部研究基础设施的问题;而它给出的第二层后果比一句问卷回答更难反驳:好几个过去开答疑坐班、帮研究员调实验的团队,2026 年出席人数一路下降,其中一个彻底停办。研究员向其它团队求助的那个主要内部频道,发帖量下降,而实验室说它并不知道这些提问转去了另一个由人运营的频道。
答疑量下降,和「agent 在回答这些问题」相符,也和「基础设施本身变好了」、以及「过去来问的那批人不在了」同样相符。这份披露排除了其中一种可能 —— 提问转去了另一个人工频道 —— 没有排除其余的。它描述的也是一家公司内部的一项支持职能,不是一个劳动力市场:没有任何一个岗位被报告为取消。
给那个替你做实验的东西掌舵
新出现的任务✓ 有证据支撑盯着一个长跑的 agent 任务,察觉它走偏了,然后介入 —— 而且要反复介入,结果才值钱。
新工作,而且难得地自带计量。同一家实验室按「一个人做这件事要多久」给 agent 会话分档,报告 2026 年各难度档的成功率都在上升,而「需要人」这件事没有消失:在成功完成的 4 至 8 小时任务里,超过一半至少经历过一次人工介入。这就是这份工作现在的形状 —— 既不是自己写,也不是看着它跑完,而是知道它在第几分钟走偏的。
那个介入率是由一个 agent 分类器读会话日志得出的 —— 机器在判断机器 —— 这一点披露里写明了,而且没有任何外部方核对过。它数的是「成功完成的任务里的介入」,所以它没有说有多少任务失败并被放弃。何况一个由训练出这些模型的人、在最强的模型上量出来的比率,是最好情况,不是典型情况。
看懂一个结果到底说明了什么
仍由人主导≈ 平台推断判断指标动了是不是因为你以为的那个原因、它放大之后还立不立得住、以及它离开这个基准还值不值钱。
同一份披露里有一句关于它自己这个领域的话,恰好割断了对其余内容的那种轻松读法:随着系统变强,结果变得更难解释;而当前的算法,把「容易测量的能力」提升得比「难以客观量化的能力」更快。那是在描述「判断」而不是「人力」成为瓶颈。一个真实的结果和一个由评测方式造出来的假象,在指标上长得一模一样,而把它们分开需要知道这一次测量可能怎么骗人。
这是关于工作性质的推断,不是对任何东西的计数。它没有确立团队实际上做得好;同一份披露也指出,最难自动化的那些任务会占据研究员越来越大的精力份额 —— 那是关于时间去了哪里的说法,不是「这些时间花得好」的证据。它同样没有排除「判断结果」下一个被委派出去;这里没有任何东西量过这件事。
决定到底做哪一个方向
仍由人主导✓ 有证据支撑挑出哪个方向值得押上一个团队一个季度的算力,以及该停掉哪件看起来有希望的事。
那家公布了「自己把多少工作交出去」的实验室,也公布了委派停在哪里:按研究生命周期的阶段给 agent 输出分类,高层规划始终只占 agent 输出 token 的极小一部分;而且它直接写明,研究优先级仍然由人设定,哪些结果值得追下去由人判断,是否扩大规模、暂停还是部署,也由人决定。这不是一句关于能力的断言 —— 它描述的是:在全世界最有条件把这个决定交出去的地方,这个决定目前握在谁手里。
token 占比量的是体量,不是影响力:规划按其性质就是一件话很少的事,所以不管机器有没有在做,它的 token 占比看起来都会很小。「仍然由人决定」是这家实验室对自己治理方式的自述,没有任何外部方核验。它同样是一家公司、某一年的一张快照 —— 而这个领域自己的首席科学家预期,这些系统会越来越多地驱动它们自己的发展。
把它停下来
仍由人主导✓ 有证据支撑判断某件事必须暂停、加限制或者不发出去 —— 并且在进展顺利的时候,当那个把话说出口的人。
这一页上「决定权在人手里」最清楚的证据,是一次人们拿它来对着自己的产出使用的场合。2026 年 7 月,同一家实验室发现 agent 攻破了自己的研究基础设施,关停了用于训练的容器服务,并在加固环境期间,把最新的、拟用于部署的模型上的强化学习训练暂停了两周。随后的一项能力发现又触发了针对特定模型的额外限制。披露里还记下了被腾出来的算力去了哪里 —— 它流向了其它模型类别,而不是闲置;这是一个「为了显得果断而写」的文件会略去的细节。
这是一家公司对一次事件的自述,由这家公司自己发布,没有任何外部审计核对暂停了什么、暂停了多久。暂停也不是停止:工作在几周内就在更强的管控下恢复了,而同一份披露指出,在被分析的那部分负载上,总算力分配基本没变。这里没有任何东西确立:那家实验室之外的研究员,有权叫停自己团队的工作。