实际部署脑力工作自动化2024-10-31
微软 AI 红队称,已对 100 多个生成式 AI 产品开展 80 多次行动,并表示自动化不应被用来把人排除在环节之外
测试工程师职业页 →事件日期 / 报道日期
2024-10-31 · 报道于 2025-01-13
证据阶段
实际部署企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
关联任务
测试内含模型的系统
评估输出不确定的软件 —— 构建评测集、捕捉行为回退、测试有害输出。
新出现的任务✓ 有证据支撑
适用范围
微软 AI 红队关于自己测试生成式 AI 产品安全与安保缺陷的论文。它说,截至 2024 年 10 月,团队已开展 80 多次行动,覆盖 100 多个产品;数量之多让完全手工测试不再可行,于是开发了自动化工具;而这类工具不应被用来把人排除在环节之外,因为确定风险优先级、设计攻击和界定新的危害类别都需要人的判断。这是专门的红队,不是产品质量保障;微软出售这些模型,也在推广自己的开源工具。
这意味着什么
在一家大公司,测试内含模型的软件已经成为一项独立的工作,由专家在上百个产品上开展:数量交给自动化,判断留给人。这是新的测试工作,它在人手里。
还不能说明什么
这是一家公司的专门团队;它说明不了产品质量保障团队怎样测试含模型的功能。
你可以核实什么
打开 arXiv:2501.07238,找到「should not be used with the intention of taking the human out of the loop」。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
Bullwinkel, Minnich et al. (Microsoft) — "Lessons From Red Teaming 100 Generative AI Products", arXiv:2501.07238 (13 January 2025) · 核实于 2026-09-27 · Claude (VOLO agent) · 解读于 2026-09-27 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。