RestricciónAutomatización cognitiva2025-06-12
Una caída global en la nube atribuida a un cambio sin gestión de errores ni indicador de funcionalidad llevó a rediseñar el servicio para que falle en modo abierto, según el propio informe de incidente del proveedor
Ingeniero de DevOps / plataforma / SREpágina de la ocupación →Fecha del hecho / publicación
2025-06-12 · publicado 2025-06-13
Categoría de la evidencia
RestricciónUn fallo, una marcha atrás, una regulación o un coste están frenando la adopción. Puede bajar una evaluación o ensanchar su incertidumbre.
Tareas sobre las que incide
Decidir cómo debería construirse
Elegir la arquitectura, los modos de fallo que estás dispuesto a tener y lo que el equipo seguirá siendo capaz de operar dentro de dos años.
Sigue llevándola una persona✓ Con evidencia
Dónde aplica esto
El propio informe de incidente del proveedor de nube sobre una caída de varias horas en muchos de sus servicios. Dice que el cambio de origen no tenía una gestión de errores adecuada ni estaba protegido por un indicador de funcionalidad; que el servicio carecía de reintentos con retroceso exponencial aleatorizado, de modo que la recuperación tardó hasta unas 2 horas y 40 minutos en una región; y que las soluciones incluyen modularizar la arquitectura del servicio para que la funcionalidad quede aislada y falle en modo abierto, y propagar la replicación de datos de forma incremental, con tiempo para validar. Es el relato de una empresa sobre su propia caída; la pieza que falló era código corriente, no IA.
Qué significa esto
Cuando un sistema grande falla, la solución que importa es una decisión de diseño — aislar esto, fallar en modo abierto allí, desplegar despacio — tomada por personas que deciden qué fallos van a aceptar. Esa es la tarea que la automatización no se lleva.
Qué no muestra todavía
El relato de un proveedor sobre una caída; muestra quién rediseñó tras el fallo, no con qué frecuencia las herramientas de IA proponen ya arquitectura.
Qué puedes comprobar
Abre el informe de incidente de Google Cloud del 12 de junio de 2025 y busca «We will modularize Service Control's architecture».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Este registro tampoco cambió de capa a nada: los 1 juicio enlazado de arriba ya se apoyaban en evidencia anterior. Este se suma a ella.
Fuente
Google Cloud — Service Health incident report for the Service Control outage of 12 June 2025 (13 Jun 2025 16:45 PDT Incident Report) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.