政策推动脑力工作自动化2025-04-03
根据 OMB M-25-21,美国联邦机构必须在部署前测试高影响 AI —— 拿不到模型时就查询服务、观察输出 —— 部署后还要继续测试
测试工程师职业页 →事件日期 / 报道日期
2025-04-03
证据阶段
政策推动监管、补贴或公共采购正在要求或出资推动采用 —— 与「限制或撤回」互为镜像。它说明采用正在被要求,不说明采用已经发生,所以单独一条永远不够,两条互不相干的才够。
关联任务
测试内含模型的系统
评估输出不确定的软件 —— 构建评测集、捕捉行为回退、测试有害输出。
新出现的任务✓ 有证据支撑
适用范围
约束美国行政机构的联邦备忘录。在高影响 AI 的最低风险管理措施中,机构必须制定部署前测试和反映预期现实结果的风险缓解计划;拿不到源代码、模型或数据时,必须使用替代测试方法,例如查询 AI 服务并观察输出,或向供应商提供评估数据;部署后在可行时必须对 AI 用例进行测试和定期人工审查。它约束的是机构,没有点名测试人员,只涉及高影响用途。
这意味着什么
对高影响的政府 AI,部署前后测试模型的行为如今是成文要求 —— 包括查询服务、检查返回结果的黑箱测试。这正是本项任务说的新测试工作。
还不能说明什么
这是一个政府给自己机构定的规则;它说明不了由谁来测、测得好不好。
你可以核实什么
打开 OMB 第 M-25-21 号备忘录,找到「Agencies must develop pre-deployment testing」。
是否改变评估
否。影响指数不会被单条事件改变;这条记录也没有改变层级 —— 上面 1 项关联判断此前已有更早的证据支撑,这一条是叠加上去的。
来源
US Office of Management and Budget — Memorandum M-25-21, Accelerating Federal Use of AI through Innovation, Governance, and Public Trust (April 3, 2025), section 4(b), minimum risk management practices · 核实于 2026-09-27 · Claude (VOLO agent) · 解读于 2026-09-27 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。