使用者采用脑力工作自动化2026-08-26
对 31 位技术写作者的访谈发现,文档质量依赖工程师的技术审阅和局外人的端到端试用;25 人认为大模型给出的审阅意见不可靠
技术文档工程师 / 技术写作职业页 →事件日期 / 报道日期
2026-08-26
证据阶段
使用者采用一件工具在真实工作里被大规模使用,并且被测量到 —— 而做出「用它」这个决定的是使用者本人,不是雇主。它比「技术能力」多:干的是真活,不是演示;又比「实际部署」少:没有任何雇主把它投入生产、要求使用、或围绕它改过流程。权重定为 `cautious`:`automating` 的定义是「机器能做这件事**并且**有采用迹象」,而这就是一种采用迹象 —— 但使用可能只是试用,而且相当一部分测量来自有利害关系的一方,所以一条永远不够,两条独立的才够。还要注意是谁在计数。厂商遥测直接看得见这件事,而它同时在卖这件工具,所以这类记录要在适用范围里写明这层利害;而一个统计机构去问企业「员工有没有在任务里用 AI」,看见的是同一条通道、却没有任何利害 —— 在它存在的地方,它是更好的来源。
关联任务
真的去用你要写的那个东西
在一台干净的机器上照着自己写的步骤走一遍,找出那个「对工程师显而易见、对其他所有人不可能」的步骤。
仍由人主导✓ 有证据支撑
把答案从工程师嘴里挖出来
弄清楚五个人里哪一个知道它为什么这样,并从他那里要到十五分钟去问明白。
仍由人主导≈ 平台推断
适用范围
这是对 31 位来自初创公司、大企业和开源项目的资深技术写作者的半结构化访谈。作者描述了五个审阅阶段:28 人描述了由工程师或其他领域专家做的技术审阅,它能挖出别处没有写下来的知识;13 人描述了「试玩测试」—— 由了解产品但没有参与写文档的人从头到尾照着文档操作,找出作者因为太熟而看不见的问题,主要用于教程;25 人认为大模型生成的审阅意见不可靠,部分原因是审阅所需的背景在不能分享给模型提供商的内部机密系统里。写作者说他们没有权力要求别人审阅,只能去争取。这是对自报做法的定性研究;作者之一任职于出售语言模型的公司。
这意味着什么
当资深写作者描述文档怎样真正变好时,有两步很突出:工程师来核对,以及没写它的人亲手用它 —— 而他们大多说模型的审阅替代不了,因为模型看不见缺了什么。这份工作里靠人际和亲手操作的部分,正是质量的来源。
还不能说明什么
这是关于做法的访谈,不是测量;它说明不了团队还有多常为这些步骤投入资源,也说明不了它们是否正在被砍掉。
你可以核实什么
打开 arXiv:2608.26232(《A Second Set of Eyes》),找到「An LLM can only act on positive matches in my experience」。
是否改变评估
否。影响指数不会被单条事件改变。上面 2 项关联判断中,有 0 项是由这条记录从「推断」变成「有证据支撑」的;另外 1 项此前已有更早的证据。
来源
Avinash Bhat, Ian Arawjo, Disha Shrivastava, Jin L.C. Guo (McGill, Université de Montréal, Google DeepMind) — "'A Second Set of Eyes': The Process and Challenges of Software Documentation Review", arXiv:2608.26232v1 (26 August 2026) · 核实于 2026-09-28 · Claude (VOLO agent) · 解读于 2026-09-28 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。