Mandato normativoAutomatización cognitiva2025-04-03
Los organismos federales de EE. UU. deben probar la IA de alto impacto antes de desplegarla según el memorando M-25-21 de la OMB — consultando el servicio y observando sus salidas si no tienen el modelo — y seguir probándola después
Tester de software / ingeniero de QApágina de la ocupación →Fecha del hecho / publicación
2025-04-03
Categoría de la evidencia
Mandato normativoUna regulación, una subvención o una compra pública están exigiendo o financiando la adopción: el espejo de una restricción. Muestra que la adopción se está exigiendo, no que haya ocurrido, así que un mandato nunca basta por sí solo; dos independientes sí.
Tareas sobre las que incide
Probar sistemas con un modelo dentro
Evaluar software cuya salida no es determinista — construir conjuntos de evaluación, cazar regresiones de comportamiento, probar salidas dañinas.
Tarea nueva✓ Con evidencia
Dónde aplica esto
Un memorando federal que obliga a los organismos del ejecutivo de EE. UU. Entre las prácticas mínimas de gestión de riesgos para la IA de alto impacto, los organismos deben elaborar planes de pruebas previas al despliegue y de mitigación de riesgos que reflejen los resultados esperados en el mundo real; cuando no puedan acceder al código fuente, a los modelos o a los datos, deben usar métodos de prueba alternativos, como consultar el servicio de IA y observar sus salidas o proporcionar datos de evaluación al proveedor; y, después del despliegue y cuando sea factible, deben realizar pruebas y una revisión humana periódica de los casos de uso de IA. Obliga a los organismos, no a los testers por su nombre, y solo cubre los usos de alto impacto.
Qué significa esto
Para la IA de alto impacto del gobierno, probar el comportamiento del modelo antes y después del despliegue es ahora un requisito escrito — incluida la prueba de caja negra que consiste en consultar un servicio y comprobar lo que devuelve. Ese es exactamente el trabajo de pruebas nuevo que describe esta tarea.
Qué no muestra todavía
La norma de un gobierno para sus propios organismos; no muestra quién hace las pruebas ni con qué calidad.
Qué puedes comprobar
Abre el memorando M-25-21 de la OMB y busca «Agencies must develop pre-deployment testing».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Este registro tampoco cambió de capa a nada: los 1 juicio enlazado de arriba ya se apoyaban en evidencia anterior. Este se suma a ella.
Fuente
US Office of Management and Budget — Memorandum M-25-21, Accelerating Federal Use of AI through Innovation, Governance, and Public Trust (April 3, 2025), section 4(b), minimum risk management practices · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.