使用者采用脑力工作自动化2024-03-31
在一家托管检测公司的安全运营中心,45 名分析师十个月里向 GPT-4 提了 3,090 次问题;只有 4% 要求下结论(如「这是恶意的吗?」),其余都是要解释
网络安全分析师 / 安全运营职业页 →事件日期 / 报道日期
2024-03-31 · 报道于 2025-09-19
证据阶段
使用者采用一件工具在真实工作里被大规模使用,并且被测量到 —— 而做出「用它」这个决定的是使用者本人,不是雇主。它比「技术能力」多:干的是真活,不是演示;又比「实际部署」少:没有任何雇主把它投入生产、要求使用、或围绕它改过流程。权重定为 `cautious`:`automating` 的定义是「机器能做这件事**并且**有采用迹象」,而这就是一种采用迹象 —— 但使用可能只是试用,而且相当一部分测量来自有利害关系的一方,所以一条永远不够,两条独立的才够。还要注意是谁在计数。厂商遥测直接看得见这件事,而它同时在卖这件工具,所以这类记录要在适用范围里写明这层利害;而一个统计机构去问企业「员工有没有在任务里用 AI」,看见的是同一条通道、却没有任何利害 —— 在它存在的地方,它是更好的来源。
关联任务
判定这是一次事件
拍板:把人叫起来、把一套系统从网络上摘下来、告诉业务方出事了 —— 在信息不完整、而且还不能确定的时候。
仍由人主导✓ 有证据支撑
适用范围
澳大利亚国家科学机构的研究人员与这家安全公司的合著者一起,分析了 eSentire —— 一家出售 7×24 小时托管检测与响应服务的公司 —— 的 45 名分析师在 2023 年 5 月至 2024 年 3 月的实际调查中向 GPT-4 提交的 3,090 次提问。他们发现模型主要用来解读命令之类的底层遥测数据、润色书面沟通,交互都很短;只有 4% 的提问要求明确的建议,如「这是恶意的吗?」,作者把这解读为分析师强烈倾向于保留决定权。这是一家公司的安全运营中心,测的是分析师问了什么而不是回答准不准,而且这家公司有商业利益。
这意味着什么
即使在一家把事件检测当作服务出售的公司里,手边有模型的分析师也几乎从不问它「这是不是恶意的」—— 他们让它解释,然后自己下判断。下结论正是人们留在自己手里的部分。
还不能说明什么
这是一家公司 2023–24 年的分析师,测的是问了什么而不是效果;它说明不了雇主会不会一直留人来下这个判断。
你可以核实什么
打开 arXiv:2508.18947(《LLMs in the SOC》),找到「Only 4% of queries sought explicit recommendations」。
是否改变评估
否。影响指数不会被单条事件改变;而且「使用者采用」这一档单条本来就不改变层级 —— 它算进判断所需的条数,但要再有一条独立记录,这项判断才算「有证据支撑」。本条已计入;单独它什么也没改变。
来源
Ronal Singh, Shahroz Tariq, Fatemeh Jalalvand, Mohan Baruwal Chhetri et al. (CSIRO Data61 with eSentire) — "LLMs in the SOC: An Empirical Study of Human-AI Collaboration in Security Operations Centres", arXiv:2508.18947v2 (19 September 2025) · 核实于 2026-09-28 · Claude (VOLO agent) · 解读于 2026-09-28 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。