Despliegue realAutomatización cognitiva2024-10-31
El AI Red Team de Microsoft dice que ha realizado más de 80 operaciones sobre más de 100 productos de IA generativa, y que la automatización no debería usarse para sacar a la persona del circuito
Tester de software / ingeniero de QApágina de la ocupación →Fecha del hecho / publicación
2024-10-31 · publicado 2025-01-13
Categoría de la evidencia
Despliegue realUna empresa lo ha puesto en producción. Puede mover la línea de base, ponderado por la escala y por cuánto se parece ese entorno al tuyo.
Tareas sobre las que incide
Probar sistemas con un modelo dentro
Evaluar software cuya salida no es determinista — construir conjuntos de evaluación, cazar regresiones de comportamiento, probar salidas dañinas.
Tarea nueva✓ Con evidencia
Dónde aplica esto
Un artículo del AI Red Team de Microsoft sobre su propio trabajo probando productos de IA generativa en busca de fallos de seguridad y de ciberseguridad. Dice que, a octubre de 2024, el equipo había realizado más de 80 operaciones que cubrían más de 100 productos, que el volumen hacía inviable probarlo todo a mano y por eso construyó automatización, y que esas herramientas no deberían usarse con la intención de sacar a la persona del circuito, porque priorizar riesgos, diseñar ataques y definir nuevas categorías de daño requieren juicio humano. Es un equipo rojo dedicado, no QA de producto, y Microsoft vende los modelos y promociona su herramienta de código abierto.
Qué significa esto
Probar software con un modelo dentro se ha convertido en una operación propia en una gran empresa, llevada por especialistas en un centenar de productos, con la automatización poniendo el volumen y las personas el juicio. Es trabajo de pruebas nuevo, y está en manos de personas.
Qué no muestra todavía
El equipo especializado de una empresa; no muestra cómo prueban los equipos de QA de producto las funciones basadas en modelos.
Qué puedes comprobar
Abre arXiv:2501.07238 y busca «should not be used with the intention of taking the human out of the loop».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Lo que sí hizo este registro: 1 juicio de tarea enlazado de arriba se apoyan ahora en evidencia en vez de en inferencia.
Fuente
Bullwinkel, Minnich et al. (Microsoft) — "Lessons From Red Teaming 100 Generative AI Products", arXiv:2501.07238 (13 January 2025) · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.