Capacidad técnicaAutomatización cognitiva2026-04-24
En Cornetto, un banco de pruebas de 231 problemas de reparación de configuraciones de red, el mejor de nueve modelos de lenguaje resolvió por completo solo el 25% de los escenarios
Ingeniero de redespágina de la ocupación →Fecha del hecho / publicación
2026-04-24
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Configuración y cambios
Hacer cambios de configuración en routers, conmutadores, cortafuegos y redes de radio, y gestionarlos de forma segura.
Automatizándose✓ Con evidencia
Dónde aplica esto
Un banco de pruebas de 231 problemas de corrección de configuraciones en topologías de red de 20 a 754 nodos, comprobados mediante verificación formal, en el que se evaluaron nueve modelos de lenguaje. El artículo informa de que el modelo con mejor rendimiento resolvió solo el 25% de los escenarios, de que las resoluciones estrictamente correctas — todas las averías corregidas sin regresiones — se dieron como mucho en el 25,5% de los casos, y de que lo mejor es desplegar los modelos como asistentes con una persona en el circuito. Es una prepublicación sobre escenarios sintetizados.
Qué significa esto
Los cambios rutinarios pueden automatizarse; reparar una configuración rota en una red grande sigue estando mayormente fuera del alcance de los modelos de lenguaje. La corrección compleja — y la comprobación de que no rompe nada más — sigue en manos del ingeniero.
Qué no muestra todavía
Un banco de pruebas en prepublicación sobre escenarios sintetizados; no mide operaciones reales.
Qué puedes comprobar
Abre arXiv 2604.22513 y busca «resolved only 25% of scenarios» en el artículo.
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 1 juicio enlazado de arriba se quedan donde estaban.
Fuente
Protogeros, Asadli, Hoffman, Vanbever (ETH Zürich) — Benchmarking LLM-Driven Network Configuration Repair, arXiv 2604.22513 (submitted 24 Apr 2026) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.
Este registro se cita en