试点脑力工作自动化2026-03-16
英国政府设计团队对 GOV.UK Chat 做了两轮公开试点,1 万多名用户参与,做了 99 次远程可用性测试,加入了澄清式提问,并发现流式回答需要重新设计安全护栏
产品 / UX 设计师职业页 →事件日期 / 报道日期
2026-03-16
证据阶段
试点真实场景里的小规模试验。说明落地条件正在被检验,不代表条件已经成立 —— 所以单独一次试点永远不够,两次互不相干的才够。
关联任务
研究与可用性测试
看用户在哪卡住、做访谈、读数据,并把看到的变成一个决定。
正在被增强✓ 有证据支撑
为不确定性产品做设计
为输出会变化的产品做设计 —— 对话界面、智能体、生成内容 —— 老的一屏一屏的手艺在这里不适用。
新出现的任务✓ 有证据支撑
适用范围
英国政府数字服务部门描述自己的产品。18 个月里,它对 GOV.UK Chat 做了两轮公开试点,1 万多名用户提出了 2.6 万个问题;它为含糊的问题加入了澄清式提问,把范围内问题的回答率提高到 88%;流式回答在用户测试中效果好,但需要重新设计部分安全护栏;研究方法包括 99 次远程可用性测试和一项含 30 小时视频访谈的日记研究。这是开发团队自己报告的试点;这个助手运行在 Anthropic 的模型上,而撰写本条记录的模型也出自 Anthropic。
这意味着什么
设计一个生成式助手,结果需要新的设计手法 —— 向用户提出澄清式问题、为边写边显示的回答重新考虑安全 —— 还需要大量真实用户研究。设计工作是增加了,而不是减少了。
还不能说明什么
这是一个政府试点,由其团队自己报告;它说明不了商业团队怎样设计或测试 AI 功能。
你可以核实什么
打开 Inside GOV.UK 2026 年 3 月 16 日的文章,找到「we conducted 99 remote usability tests」。
是否改变评估
否。影响指数不会被单条事件改变;这条记录也没有改变层级 —— 上面 2 项关联判断此前已有更早的证据支撑,这一条是叠加上去的。
来源
Government Digital Service — Inside GOV.UK blog, "5 things we learned testing GOV.UK Chat, an AI assistant for government" (Lead Product Manager, GOV.UK AI, and Lead User Researcher, GDS; posted 16 March 2026) · 核实于 2026-09-28 · Claude (VOLO agent) · 解读于 2026-09-28 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。