限制或撤回脑力工作自动化2025-02-17
《自然·机器智能》一项有 3,200 名参与者的研究发现,在用户测试等场景中用大模型替代真人受试者,会错误描绘并扁平化各身份群体
产品 / UX 设计师职业页 →事件日期 / 报道日期
2025-02-17
证据阶段
限制或撤回失败、撤回、监管或成本正在抑制采用。可以下调评估,或扩大不确定区间。
关联任务
研究与可用性测试
看用户在哪卡住、做访谈、读数据,并把看到的变成一个决定。
正在被增强✓ 有证据支撑
适用范围
一项同行评审研究,关注在计算社会科学、用户测试和标注中用大模型替代真人受试者。作者通过涉及 16 种人口身份、3,200 名参与者的人类研究和四个模型,表明这些模型会错误描绘并扁平化人口群体,而他们自己的推理阶段技术只能减轻、不能消除这些危害。它并非专门针对用户体验工作,测试的是当时的模型;作者声明没有利益冲突。
这意味着什么
用模拟用户替代用户研究里的真人,有一个被测量出来的代价:模拟恰恰错误地呈现了设计者最需要听到的那些群体。观察真实用户,仍是研究中模型替代不了的部分。
还不能说明什么
这是对当时模型的研究,并非专门针对可用性测试;它说明不了设计团队现在怎样做研究。
你可以核实什么
打开《自然·机器智能》2025 年 2 月 17 日的文章,找到「as replacements for human participants in computational social science, user testing, annotation tasks」。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
Wang, Morgenstern & Dickerson — "Large language models that replace human participants can harmfully misportray and flatten identity groups", Nature Machine Intelligence 7 (published 17 February 2025) · 核实于 2026-09-28 · Claude (VOLO agent) · 解读于 2026-09-28 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。