La pregunta
Qué se automatiza de verdad, y cómo saberlo de antemano
No lo difícil que sea la tarea. No lo bien pagada que esté. La propiedad que predice si una tarea se movió es si algo que no es un ser humano puede decir «eso está mal, inténtalo otra vez», y decirlo mil veces por la noche sin cansarse.
Dos empresas, dos capas de la pila, la misma maquinaria
Airbnb publicó su relato de la migración de casi 3.500 ficheros de pruebas de componentes de React de un marco de pruebas a otro: seis semanas frente a una estimación a mano de un año y medio, con el 75% de los ficheros resueltos en la primera tanda masiva de cuatro horas. Amazon publicó que movió decenas de miles de sus propias aplicaciones Java en producción a una versión más nueva de Java, estimando el equivalente manual en más de 4.500 años de trabajo de desarrollo.
Ninguno de los dos va de escribir software nuevo. Los dos van de cambiar software que ya existe y que tiene que seguir funcionando. Y los dos funcionaron por una razón que cada empresa enuncia sin rodeos: cada paso del trabajo tiene un árbitro automático. El compilador rechaza lo que no va a compilar; la batería de pruebas caza casi todo lo que compila y está mal; el analizador de estilo y el verificador de tipos cazan el resto. Airbnb modeló su migración como una máquina de estados en la que un fichero solo avanza cuando pasa la comprobación anterior, y después simplemente reintentó: casi todos los ficheros terminaron en menos de diez intentos.
Ese es todo el truco, y merece decirse con palabras llanas: el modelo no era mejor que una persona en esto. Se le permitió equivocarse, barato, miles de veces, sin nadie mirando. Un ingeniero humano no puede equivocarse cien veces en un mismo fichero. Un bucle sí.
- Airbnb informa de haber migrado casi 3.500 ficheros de pruebas de componentes de React de Enzyme a React Testing Library en seis semanas, frente a una estimación manual de un año y medio
- Amazon dice haber movido decenas de miles de sus propias aplicaciones Java de producción de Java 8 u 11 a Java 17 con un agente, y estima el equivalente manual en más de 4.500 años de trabajo de desarrollo
Airbnb publicó también el techo, que es lo más raro
Un tres por ciento de los ficheros no se fue. A cada uno de ellos se le había reintentado entre cincuenta y cien veces antes de que el equipo parara y los terminara a mano. Esa cifra sirve más que el 97% que tiene encima, porque es una medición de la parte a la que la automatización no pudo llegar ni siquiera cuando reintentar salía casi gratis.
Fíjate además en qué dice el equipo que marcó la diferencia en los ficheros difíciles: no una mejor redacción de la indicación, sino elegir qué ficheros relacionados poner delante del modelo, hasta cincuenta de ellos, con indicaciones que llegaban a cien mil componentes de texto. La entrada escasa era saber qué partes de la base de código eran relevantes. Eso es un juicio sobre el código de una empresa concreta, y lo hizo la gente que trabaja allí.
El caso inverso: quita el árbitro y la dirección se invierte
Un ensayo controlado aleatorizado hecho por METR les dio a dieciséis mantenedores experimentados de código abierto 246 incidencias reales en bases de código que conocían bien. Con herramientas de 2025 fueron un 19% más lentos. Creían que habían ido un 20% más rápidos. La misma tecnología, aplicada a un trabajo en el que la respuesta correcta no es comprobable mecánicamente y quien desarrolla ya tiene el contexto, movió la cifra en la otra dirección, y movió la percepción de esa gente en dirección contraria a la medición.
Esa última parte es por lo que en este sitio lo que uno declara sobre sí mismo no es evidencia. La gente del ensayo tenía experiencia, tenía motivación, y se equivocaba sobre su propia velocidad en alrededor de cuarenta puntos porcentuales.
Cuatro pruebas de referencia dicen lo mismo desde el otro lado
Spider 2.0 plantea preguntas de datos de empresa sobre almacenes reales: mil columnas, varios dialectos de SQL, documentación y un repositorio de proyecto donde hay que buscar. Un agente de código resolvió el 21,3% de ellas, frente al 91,2% en la versión académica de la misma tarea. Beaver, construido a partir de registros de consultas de almacenes corporativos reales, deja a un modelo de lenguaje sin más en cero donde las pruebas públicas dan entre 80 y 90. En las 537 preguntas del Finance Agent Benchmark, escritas por expertos sobre documentos regulatorios recientes, los mejores modelos se quedan muy lejos de una persona analista.
GDPval, de OpenAI, que recoge entregables reales de 44 ocupaciones y hace que personas expertas del sector califiquen a ciegas la salida del modelo frente a ellos, publica la pendiente sin rodeos: la tasa de victorias es más alta en las tareas de cero a dos horas y baja de forma sostenida a medida que la tarea se alarga. Cuanto más dura una tarea, mayor parte de ella consiste en decisiones que nada puede comprobar hasta el final.
Ninguna de estas cifras dice nada sobre lo listo que es un modelo. Dicen dónde deja de funcionar el árbitro. Cuando la respuesta correcta depende de cuál de las tablas de esta empresa es la buena, o de cuál de dos registros duplicados hay que conservar, o de qué quería decir en realidad el cliente, no hay nada que pueda decirlo salvo una persona.
- Sobre 632 flujos de trabajo de datos de empresa sacados de almacenes reales, un agente de código resolvió el 21,3% — frente al 91,2% en la versión académica de la misma tarea
- En Beaver, un banco de pruebas de texto a SQL construido con registros reales de consultas de almacenes corporativos, un LLM a secas sacó cero y un montaje agéntico llegó al 10% aproximadamente, frente al 80-90% y más en los bancos de pruebas públicos
- En el Finance Agent Benchmark — 537 preguntas escritas por expertos sobre documentos recientes presentados a la SEC — el mejor modelo, o3 de OpenAI, llegó a un 46,8% de acierto a 3,79 dólares por consulta
- El banco de pruebas GDPval de OpenAI recogió entregables reales de agentes de compras e hizo que expertos del sector puntuaran a ciegas el resultado de los modelos frente a ellos
Qué pasa cuando el trabajo sale sin árbitro
Tribunales federales de Estados Unidos han sancionado a abogados por escritos levantados sobre citas de sentencias que no existen: una multa de 5.000 dólares en un caso, la revocación de la habilitación en otro. Una lista de lecturas de verano distribuida por sindicación salió en el Chicago Sun-Times y en el Philadelphia Inquirer con libros que nunca se escribieron. Los subtítulos en alemán de Crunchyroll para el estreno de un anime contenían la frase «ChatGPT dijo…». El Tribunal Supremo de Florida ha modificado desde entonces sus normas para que firmar un escrito sea en sí mismo una declaración sobre la autoridad legal citada en él.
No son fallos graciosos, son la misma estructura que los aciertos. Donde el paso de comprobación era mecánico, la máquina lo hizo. Donde el paso de comprobación era una persona, y se quitó a esa persona precisamente para ahorrarse la comprobación, el error llegó al mundo exterior, y entonces el árbitro pasó a ser un tribunal, una redacción o un regulador, a posteriori y a un coste mucho más alto.
- Un tribunal federal de EE. UU. multó con 5.000 dólares a dos abogados y a su despacho por un escrito que citaba seis sentencias inexistentes generadas por ChatGPT, y señaló que usar una herramienta de IA fiable no es en sí mismo indebido
- Un tribunal federal de Wyoming multó a tres abogados y revocó la admisión pro hac vice de uno de ellos después de que un escrito presentado citara nueve sentencias, ocho de las cuales no existían
- El Tribunal Supremo de Florida modifica la Regla 2.515(d)(2): firmar un escrito supone declarar que las fuentes jurídicas citadas existen y son exactas, con sanciones posibles, con efecto desde el 15 de junio de 2026
- El Chicago Sun-Times y el Philadelphia Inquirer publicaron una lista sindicada de lecturas de verano con libros que no existen; el colaborador dijo que había usado una herramienta de IA y que la sección no se revisó
- Los subtítulos en alemán de Crunchyroll para el estreno de un anime contenían la línea «ChatGPT dijo…»; la empresa afirmó que un proveedor externo había usado subtítulos generados por IA incumpliendo el contrato
Qué hacer con esto el lunes
Coge tu propia lista de pendientes y marca en cada punto qué te diría que está terminado: una marca verde que aparece sin ti, o una persona mirándolo. La primera lista es la que está a punto de abaratarse, sea cual sea tu sector. Saber cuánto ocupa esa lista dentro de tu propio trabajo vale más que cualquier porcentaje publicado, y nadie más puede calculártelo.
Después mira la segunda lista y hazte una pregunta más incómoda: la comprobación que haces, ¿la ve quien decide tu presupuesto? El patrón que se repite en estos registros es que el paso de revisión es lo primero que se recorta, porque no produce ningún entregable, y su ausencia tarda dos trimestres en notarse.
Qué no establece esto
La propiedad del árbitro automático explica qué tareas se movieron en los casos que tenemos; no es una ley y no predice. Dos de los registros más fuertes que hay aquí son empresas publicando sobre su propia ingeniería, con sus propias estimaciones de qué habría pasado de otro modo, que nadie de fuera comprobó. Nada de esto establece que alguien haya perdido un empleo: ninguno de los despliegues informa de un cambio de plantilla, y nosotros tampoco lo hacemos. Y que hoy una tarea no tenga árbitro automático no es seguridad: significa que las herramientas actuales no tienen una forma barata de iterar sobre ella, lo cual es una afirmación sobre las herramientas.
Todo lo que se cita aquí
Cada una abre el registro entero: su fuente y su nivel de fuente, las fechas, el ámbito al que se aplica, quién lo verificó y qué no establece.
- Airbnb informa de haber migrado casi 3.500 ficheros de pruebas de componentes de React de Enzyme a React Testing Library en seis semanas, frente a una estimación manual de un año y medio — The Airbnb Tech Blog (Airbnb's own engineering blog)
- Amazon dice haber movido decenas de miles de sus propias aplicaciones Java de producción de Java 8 u 11 a Java 17 con un agente, y estima el equivalente manual en más de 4.500 años de trabajo de desarrollo — AWS DevOps & Developer Productivity Blog (Amazon's own)
- Un ensayo aleatorizado de METR con 16 desarrolladores de código abierto con experiencia sobre 246 incidencias reales halló que tardaron un 19% más con herramientas de IA de principios de 2025, mientras creían haber ido un 20% más rápido — METR — study report
- Sobre 632 flujos de trabajo de datos de empresa sacados de almacenes reales, un agente de código resolvió el 21,3% — frente al 91,2% en la versión académica de la misma tarea — Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows (arXiv:2411.07763)
- En Beaver, un banco de pruebas de texto a SQL construido con registros reales de consultas de almacenes corporativos, un LLM a secas sacó cero y un montaje agéntico llegó al 10% aproximadamente, frente al 80-90% y más en los bancos de pruebas públicos — BLOG@CACM (Stonebraker & Chen, MIT)
- En el Finance Agent Benchmark — 537 preguntas escritas por expertos sobre documentos recientes presentados a la SEC — el mejor modelo, o3 de OpenAI, llegó a un 46,8% de acierto a 3,79 dólares por consulta — arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu)
- El banco de pruebas GDPval de OpenAI recogió entregables reales de agentes de compras e hizo que expertos del sector puntuaran a ciegas el resultado de los modelos frente a ellos — GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (OpenAI, arXiv:2510.04374)
- Un tribunal federal de EE. UU. multó con 5.000 dólares a dos abogados y a su despacho por un escrito que citaba seis sentencias inexistentes generadas por ChatGPT, y señaló que usar una herramienta de IA fiable no es en sí mismo indebido — Mata v. Avianca, Inc. (S.D.N.Y., 22 June 2023) — opinion and order on sanctions, via CourtListener
- Un tribunal federal de Wyoming multó a tres abogados y revocó la admisión pro hac vice de uno de ellos después de que un escrito presentado citara nueve sentencias, ocho de las cuales no existían — US District Court, D. Wyo. — Wadsworth v. Walmart, 2:23-cv-118-KHR, ECF No. 181 (order of Judge Kelly H. Rankin)
- El Tribunal Supremo de Florida modifica la Regla 2.515(d)(2): firmar un escrito supone declarar que las fuentes jurídicas citadas existen y son exactas, con sanciones posibles, con efecto desde el 15 de junio de 2026 — Supreme Court of Florida, No. SC2026-0673 — In re: Amendments to Florida Rule of General Practice and Judicial Administration 2.515 (2026-05-28)
- El Chicago Sun-Times y el Philadelphia Inquirer publicaron una lista sindicada de lecturas de verano con libros que no existen; el colaborador dijo que había usado una herramienta de IA y que la sección no se revisó — NBC News
- Los subtítulos en alemán de Crunchyroll para el estreno de un anime contenían la línea «ChatGPT dijo…»; la empresa afirmó que un proveedor externo había usado subtítulos generados por IA incumpliendo el contrato — Engadget
- Conseguir que la gente lo use de verdad — tarea de Responsable de implantación de IA
- Hacer que los números signifiquen algo — tarea de Responsable de sistemas de negocio