RestricciónAutomatización cognitiva2025-05-30
En 392 tareas de backend, el código del mejor modelo fue correcto y seguro solo el 35% de las veces, y cerca de la mitad de los programas funcionales de los modelos podían explotarse
Desarrollador backendpágina de la ocupación →Fecha del hecho / publicación
2025-05-30
Categoría de la evidencia
RestricciónUn fallo, una marcha atrás, una regulación o un coste están frenando la adopción. Puede bajar una evaluación o ensanchar su incertidumbre.
Tareas sobre las que incide
Quién puede ver qué
Autorización, fronteras entre inquilinos, qué se escapa en un mensaje de error, y qué expone un endpoint interno si alguien lo encuentra.
Sigue llevándola una persona✓ Con evidencia
Dónde aplica esto
Un banco de pruebas revisado por pares de 392 tareas de backend, cada una un conjunto de endpoints que implementar a partir de una especificación, con pruebas funcionales y exploits de seguridad de extremo a extremo, entre ellos control de acceso indebido y autorización incorrecta. El mejor modelo en corrección llegó al 62%; de media, cerca de la mitad de los programas correctos que producía cada modelo podían explotarse; y el mejor modelo en código correcto y seguro llegó al 35%. Son modelos de 2025 escribiendo backends enteros a partir de una especificación, no cambios dentro de una base de código existente, y algunos autores trabajan para una empresa que construye agentes de programación con IA.
Qué significa esto
Allí donde el código de backend generado funciona, a menudo no es seguro: cerca de la mitad de los programas funcionales podían vulnerarse, y el control de acceso estaba entre las debilidades probadas. Por eso la frontera de seguridad sigue en manos de una persona que la comprueba.
Qué no muestra todavía
Un banco de pruebas de backends enteros escritos a partir de una especificación por modelos de 2025, no un estudio de defectos en bases de código reales; quedará desfasado a medida que mejoren los modelos.
Qué puedes comprobar
Abre arXiv:2502.11844 (BaxBench) y busca «we could successfully execute security exploits on around half of the correct programs generated by each LLM».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Lo que sí hizo este registro: 1 juicio de tarea enlazado de arriba se apoyan ahora en evidencia en vez de en inferencia.
Fuente
Vero, Mündler et al. (ETH Zurich, LogicStar.ai and others) — "BaxBench: Can LLMs Generate Correct and Secure Backends?", arXiv:2502.11844v3 (30 May 2025; ICML 2025) · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.