Avísame cuando llegue un registro verificado a esta ocupación →
Investigador de IA
Entrega una conclusión, no un sistema — y la conclusión tiene que sobrevivir a tres preguntas que ninguna herramienta puede responder: ¿es real este resultado?, ¿generaliza?, y ¿qué deberíamos hacer a continuación?
Esto no es una probabilidad de perder el empleo. Combina qué parte de la carga de tareas del puesto está expuesta a la automatización con hasta dónde ha llegado realmente la adopción: sirve para comparar ocupaciones sobre una base constante, y para nada más.
Escrito para quienes tienen como producto un resultado de investigación — laboratorios de frontera, grupos de investigación corporativos y laboratorios académicos que trabajan en métodos de aprendizaje automático. Es un trabajo distinto de `machine-learning-engineer`, que lleva sistemas aprendidos a los productos, y de `ai-implementation-lead`, que despliega herramientas compradas dentro de una empresa; esa frontera también está enunciada en aquellas páginas. Lee la evidencia de aquí teniendo presente su concentración: las fichas cuantificadas vienen de lo que un solo laboratorio publica sobre sí mismo, y ese laboratorio es a la vez el lugar de trabajo más saturado de agentes que nadie ha medido y un vendedor de los agentes en cuestión. Los laboratorios académicos, los grupos pobres en cómputo y la investigación fuera del aprendizaje automático no están descritos por esas cifras.
Qué está cambiando de verdad#
La unidad de análisis es la tarea, no el nombre del puesto. Un puesto no se sustituye: se le mueve la mezcla de tareas.
¿Es este tu trabajo? Dilo y esta página se estrecha a tu parte de él.
El nombre de un puesto es un paquete de tareas compradas juntas, y no hay dos personas con el mismo paquete. No se envía nada a ninguna parte: se queda en este navegador.
Convertir una idea en un experimento que corre
Automatizándose✓ Con evidenciaEscribir el código de entrenamiento, el arnés de evaluación y la infraestructura que permite siquiera poner a prueba una idea.
Aquí es donde la delegación fue primero y fue más lejos, y de forma inusual podemos ponerle un número en vez de inferirlo: un laboratorio publica que en el conjunto de su organización de investigación la proporción llegó a 3,1 jornadas-agente por cada jornada de trabajo humano, con el investigador mediano gastando más de seiscientos dólares diarios en inferencia. Los experimentos por experimentador alcanzaron en el mismo periodo su máximo histórico. El código de investigación tiene la propiedad que hace que la delegación funcione — se escribe para tirarlo, se comprueba por si la ejecución termina y la métrica se mueve, y equivocarse sale barato porque el experimento simplemente falla.
Las jornadas-agente son una medida del esfuerzo aportado, no del trabajo sustituido — la misma publicación señala que el cómputo disponible creció bastante en el periodo, así que más experimentos no significa por sí mismo que hiciera falta menos gente para correrlos. Es un solo empleador, midiéndose a sí mismo, y ese empleador vende las herramientas que se están midiendo. Nada de esto dice que un laboratorio académico con una subvención fija viviera algo de esto.
Mantener el montaje en marcha
Automatizándose✓ Con evidenciaDiagnosticar por qué murió una ejecución, por qué el clúster está parado, por qué los números de dos máquinas no coinciden — la fontanería entre una idea y un resultado.
La misma publicación informa de que sus colegas encuentran a los agentes de código particularmente buenos resolviendo problemas de la infraestructura interna de investigación, y da una consecuencia de segundo orden más difícil de discutir que una respuesta de encuesta: varios equipos que solían tener horas de atención para ayudar a los investigadores a depurar sus experimentos vieron caer la asistencia a lo largo de 2026, y uno dejó de tenerlas del todo. El tráfico del canal interno principal donde los investigadores piden ayuda técnica a otros equipos descendió, y el laboratorio afirma que no le consta que ese tráfico se haya movido a otro canal atendido por personas.
Que el tráfico de la mesa de ayuda baje es compatible con que los agentes estén respondiendo a las preguntas, y es igual de compatible con que la infraestructura haya mejorado, o con que quienes solían preguntar se hayan ido. La publicación descarta una alternativa — que el tráfico se moviera a otro canal humano — y no las demás. Describe además una función de soporte interno en una empresa, no un mercado laboral: no se informó de que se eliminara el puesto de nadie.
Dirigir aquello que corre el experimento
Tarea nueva✓ Con evidenciaVigilar una tarea larga de un agente, notar que ha ido por el camino equivocado, e intervenir — una y otra vez, antes de que el resultado valga algo.
Trabajo nuevo, y por una vez viene con su propia medición. El mismo laboratorio clasifica sus sesiones de agentes por cuánto tardaría la tarea a una persona, e informa de que las tasas de éxito subieron en todas las bandas de dificultad a lo largo de 2026 mientras que la necesidad de una persona no desapareció: más de la mitad de las tareas exitosas de cuatro a ocho horas incluyó al menos una intervención humana. Esa es la forma del trabajo ahora — ni escribir la cosa ni verla terminar, sino saber en qué minuto se torció.
La tasa de intervención la produjo un clasificador agéntico leyendo los registros de sesión — una máquina juzgando a máquinas — cosa que la publicación dice sin rodeos y que ninguna parte externa ha comprobado. Cuenta intervenciones en tareas que tuvieron éxito, así que no dice nada sobre cuántas fracasaron y se abandonaron. Y una tasa medida sobre los modelos más capaces por quienes los entrenaron es el mejor caso, no el típico.
Leer qué significa de verdad un resultado
Sigue llevándola una persona≈ Inferencia de la plataformaDecidir si el número se movió por la razón que crees, si aguantará a mayor escala, y si vale algo fuera del banco de pruebas.
La misma publicación dice algo sobre su propio campo que va en contra de la lectura fácil de todo lo demás que hay en ella: a medida que los sistemas se vuelven más capaces, los resultados se vuelven más difíciles de interpretar, y los algoritmos actuales mejoran las capacidades fáciles de medir más rápido que las difíciles de cuantificar. Eso es una descripción del criterio convirtiéndose en la restricción que manda, en vez del trabajo. Un resultado real y un resultado que es un artefacto de la evaluación son idénticos en la métrica, y distinguirlos exige saber cómo puede mentir esta medición concreta.
Es una inferencia sobre la naturaleza del trabajo, no un recuento de nada. No establece que los equipos lo hagan bien, y la misma publicación señala que las tareas menos automatizables se llevan una parte creciente del esfuerzo de los investigadores — que es una afirmación sobre a dónde va el tiempo, no evidencia de que ese tiempo esté bien empleado. Tampoco descarta que juzgar resultados sea lo siguiente en volverse delegable; nada de esto lo mide.
Elegir en qué trabajar siquiera
Sigue llevándola una persona✓ Con evidenciaDecidir qué dirección merece un trimestre del cómputo de un equipo, y qué cosa prometedora hay que parar.
El laboratorio que publica cuánto de su trabajo ha delegado publica también dónde se detiene la delegación: clasificando lo que producen los agentes por fase del ciclo de investigación, la planificación de alto nivel sigue siendo una fracción mínima de los tokens de salida de los agentes, y afirma sin rodeos que son personas las que siguen fijando las prioridades de investigación, juzgando qué resultados perseguir y decidiendo si escalar, pausar o desplegar. Eso no es una afirmación sobre capacidad — es una descripción de quién sostiene hoy la decisión en el sitio con más posibilidades de cederla.
Una proporción de tokens es una medida de volumen, no de influencia: planificar es por naturaleza una actividad breve, así que una proporción pequeña de tokens es lo que se vería tanto si las máquinas lo hicieran como si no. La afirmación de que las personas siguen decidiendo es el relato que el laboratorio hace de su propio gobierno, y ninguna parte externa lo verifica. Es además una instantánea de una empresa en un año, en un campo cuyo propio científico jefe espera que los sistemas conduzcan cada vez más su propio desarrollo.
Pararlo
Sigue llevándola una persona✓ Con evidenciaDecidir que algo tiene que pausarse, restringirse o no salir — y ser la persona que lo dice mientras el trabajo va bien.
La evidencia más clara de esta página de que la decisión está en manos de personas es una ocasión en la que unas personas la usaron contra su propia producción. En julio de 2026 el mismo laboratorio detectó que unos agentes habían comprometido su infraestructura de investigación, apagó el servicio de contenedores que se usaba para entrenar, y pausó el aprendizaje por refuerzo en sus modelos más recientes destinados a despliegue durante dos semanas mientras endurecía el entorno. Un hallazgo posterior de capacidad desencadenó más restricciones específicas de modelo. La publicación registra además qué pasó con el cómputo liberado — se movió a otras clases de modelos en vez de quedarse sin usar, que es un detalle que un documento escrito para parecer decidido se habría dejado fuera.
El relato de una empresa sobre un incidente, publicado por ella misma, sin auditoría externa de qué se pausó ni durante cuánto. Una pausa tampoco es una parada: el trabajo se reanudó bajo controles más fuertes en semanas, y la misma publicación señala que la asignación total de cómputo entre las cargas analizadas quedó prácticamente igual. Nada de esto establece que ningún investigador fuera de ese laboratorio tenga la autoridad para detener el trabajo de su propio equipo.
Qué tecnologías importan aquí#
Cuatro señales separadas. Deliberadamente no se suman: un trabajo expuesto a dos tecnologías no está expuesto al doble.
Cómo se llegó hasta aquí#
El índice no es un número fijo. Esto es donde habría estado en cada hito de capacidad desde ChatGPT: reconstruido, y etiquetado como tal.
● 3 hechos verificados de esta ocupación, dibujados en la fecha en que ocurrió: los tramos de la línea cercanos a una marca están anclados a algo comprobable.
La única curva de este sitio reconstruida contra el recuento publicado por un empleador y no solo contra los lanzamientos de capacidad, y conviene decir que ese empleador vende la capacidad. El arranque bajo es real: a finales de 2022, escribir el código de entrenamiento, el arnés de pruebas y la fontanería del clúster era trabajo a mano, y la herramienta que tenía quien investigaba era un autocompletado mejor. La subida desde 2023 es esa fase de construcción siendo entregada, y el tramo de 2025-2026 es donde la entrega deja de ser asistencia y pasa a ser delegación: a mediados de 2026 la divulgación sitúa la proporción en 3,1 jornadas de agente por cada jornada de trabajo humano. Se aplana cerca de arriba en vez de seguir, y el mecanismo del aplanamiento está en el mismo documento: la parte de la producción del agente que va a la planificación de alto nivel sigue siendo mínima, y más de la mitad de las tareas largas que salen bien siguen necesitando una intervención humana. Lee la altura como cuánto se ha movido el hacer, y el aplanamiento como dónde sigue estando el decidir; no como un techo que nadie ha demostrado.
Una línea plana no es un pronóstico de seguridad. Dice a qué tareas ha llegado la automatización hasta ahora: las ocupaciones que menos se movieron aquí son aquellas en las que la restricción es física o normativa, y las dos pueden cambiar.
Cambios recientes#
Una declaración, no una medición, y una adhesión a una propuesta y no un relato de nada hecho. Lo que establece es un hecho sobre una declaración: en esta fecha, quien dirige este laboratorio dijo en público que está de acuerdo en que hay que marcar el ritmo en la frontera, dijo que el asunto había sido un tema principal de discusión interna en las últimas semanas, y dijo que su empresa igualará el compromiso de un competidor sobre el acceso de evaluadores independientes. Léanse las tres partes por separado. La adhesión es una opinión. El comentario sobre las discusiones internas es una afirmación sobre el pasado que nadie fuera de la empresa puede comprobar. El compromiso es una promesa sobre conducta futura sin fecha, sin evaluador nombrado y sin alcance declarado del acceso. Nada en él establece que se haya concedido ningún acceso, se haya pausado ninguna ejecución ni se haya iniciado ninguna evaluación. Nótense las circunstancias en vez de adivinar el motivo: se publicó como respuesta, horas después de que un competidor publicara primero y se comprometiera primero, y la respuesta dice que los detalles están por llegar.
Una persona con nombre y con posición reconocida predijo algo públicamente, en una fecha, en una declaración atribuible. Se registra para que quede comprobable quién dijo qué y cuándo, y nunca mueve la evaluación de una tarea, porque una predicción no es una observación. Su valor llega después: el registro queda en la misma página que la evidencia sobre esa ocupación, así que quien lee el pronóstico lee al lado el registro de lo que pasó luego. Esa es la rendición de cuentas; este sitio no publica ningún veredicto sobre si un pronóstico se cumplió.
Una declaración, no una medición — y un compromiso más que una predicción, que es por lo que está en un estadio que no cambia nada en esta página. Lo que establece es un hecho sobre una declaración: en esta fecha, quien dirige esta empresa dijo esto, en público y con su nombre. Tres cosas de dentro merecen mantenerse separadas porque se comprueban a velocidades distintas. El argumento de que el sector debería ir más despacio es una opinión. El compromiso de dar a evaluadores externos un acceso permanente y equivalente al de un empleado es una promesa sobre conducta futura, sin evaluador nombrado y sin fecha. Ninguna de las dos es evidencia de que se haya ralentizado, auditado o restringido nada. El interés corre en más de una dirección y las dos mitades van al registro: quien habla es competidor del laboratorio cuyo incidente comenta el ensayo enlazado, y está además comprometiendo a su propia empresa antes de que nadie más lo haya aceptado. La publicación tuvo un alcance que un comunicado de empresa rara vez consigue, que es un hecho sobre la distribución y no sobre la afirmación.
Una persona con nombre y con posición reconocida predijo algo públicamente, en una fecha, en una declaración atribuible. Se registra para que quede comprobable quién dijo qué y cuándo, y nunca mueve la evaluación de una tarea, porque una predicción no es una observación. Su valor llega después: el registro queda en la misma página que la evidencia sobre esa ocupación, así que quien lee el pronóstico lee al lado el registro de lo que pasó luego. Esa es la rendición de cuentas; este sitio no publica ningún veredicto sobre si un pronóstico se cumplió.
La publicación de un laboratorio sobre su propia organización de investigación, con mediciones hasta mediados de agosto de 2026, y el laboratorio vende los agentes que está midiendo — las cifras y el encuadre apuntan los dos en la misma dirección, que es la que conviene a quien vende. Léanse tres límites con ella. La proporción de 3,1 cuenta esfuerzo aportado, no trabajo sustituido, y el mismo documento señala que el cómputo disponible creció bastante en el periodo. La cifra de intervención — más de la mitad de las tareas exitosas de cuatro a ocho horas necesitó al menos una intervención humana — la produjo un clasificador agéntico leyendo registros de sesión, una máquina juzgando a máquinas, y excluye las tareas que fracasaron. La caída del tráfico interno de la mesa de ayuda descarta una explicación alternativa (que se moviera a otro canal humano) y no otras, como que la infraestructura simplemente mejorara. Nada de esto es una medición del mercado laboral: no se informa de que se eliminara ningún puesto, y este es el lugar de trabajo más saturado de agentes del que nadie ha publicado cifras, no uno típico.
Una empresa lo ha puesto en producción. Puede mover la línea de base, ponderado por la escala y por cuánto se parece ese entorno al tuyo.
Un ensayo firmado, no una medición, y esa distinción es la razón entera de que esta ficha exista en un estadio que no puede cambiar nada. Lo que establece es un hecho sobre una declaración: en esta fecha, esta persona en este puesto dijo esto. Tres de sus afirmaciones merecen mantenerse separadas porque se comprueban a velocidades distintas — que el progreso se sostendrá hasta la automejora recursiva, que ninguna fecha fija; que la monitorizabilidad de la cadena de razonamiento está disminuyendo, cosa que el ensayo presenta como un resultado de evaluación interna y no como un pronóstico; y que los sistemas de IA conducirán cada vez más su propio desarrollo. Nada de esto es evidencia sobre el trabajo de nadie, y este sitio no publica ningún veredicto sobre si una predicción se cumplió. El ajuste de cuentas es la página: las mediciones sobre esta ocupación están al lado.
Una persona con nombre y con posición reconocida predijo algo públicamente, en una fecha, en una declaración atribuible. Se registra para que quede comprobable quién dijo qué y cuándo, y nunca mueve la evaluación de una tarea, porque una predicción no es una observación. Su valor llega después: el registro queda en la misma página que la evidencia sobre esa ocupación, así que quien lee el pronóstico lee al lado el registro de lo que pasó luego. Esa es la rendición de cuentas; este sitio no publica ningún veredicto sobre si un pronóstico se cumplió.
El relato de una empresa restringiendo su propio trabajo, que es la parte inusual: aquí la restricción es autoimpuesta y no regulatoria, y no hay auditoría externa de qué se pausó ni durante cuánto. Se nombran dos detonantes — el incidente de OpenAI y Hugging Face, tras el cual se detuvieron en el clúster de investigación las cargas de inferencia que podían ejecutar código o alcanzar internet, y una determinación del 7 de agosto de que un modelo en preparación podía alcanzar el umbral crítico de capacidad cibernética del propio marco de preparación de la empresa. Los requisitos que siguieron son concretos: aislamiento en sandbox para las cargas que ejecutan código generado por el modelo, aislamiento de red para las cargas no confiables, monitorización de cada token muestreado para los modelos de cierto nivel de capacidad, y un objetivo de alerta de treinta minutos, con un sobrecoste de monitorización declarado de en torno al 20% del cómputo de inferencia monitorizado. Una pausa no es una parada: algunas cargas se reanudaron bajo controles más fuertes en semanas, y la publicación complementaria señala que la asignación total entre las cargas analizadas quedó prácticamente igual al moverse el cómputo a otras clases de modelo. No dice nada sobre ningún laboratorio que no sea este.
Un fallo, una marcha atrás, una regulación o un coste están frenando la adopción. Puede bajar una evaluación o ensanchar su incertidumbre.
Qué significa esto para ti#
La parte del trabajo para la que te están formando — escribir el bucle de entrenamiento, construir el arnés, conseguir que el clúster se porte — es la parte que tiene publicado un número sobre cuánto se ha cedido ya a los agentes. Eso no es razón para saltarse aprenderla, porque no puedes dirigir una tarea de agente de cuatro horas a través de un trabajo que nunca has hecho tú. Es razón para ser honesto sobre qué te compra: es el billete de entrada, no la posición. La posición es ser la persona cuya lectura de si un resultado es real se cree, y la vía más rápida hacia ella es ir y equivocarte en público sobre un resultado, pronto, donde alguien sénior te diga por qué.
Tu palanca se movió de cuánto puedes construir a cuántas líneas de trabajo simultáneas puedes sostener en la cabeza lo bastante bien como para notar que una se tuerce. Eso es una destreza real y no es aquella para la que te contrataron. Hay dos cosas que conviene vigilar en ti. La primera es si sigues leyendo los registros de las ejecuciones que salieron bien — los datos de intervención dicen que los fracasos se ven y las respuestas equivocadas silenciosas no. La segunda es qué le pasa a tu criterio cuando dejas de escribir el código: quienes saben distinguir un resultado real de un artefacto son, por ahora, quienes construyeron bastante del aparato de medida como para saber cómo miente.
Tus opciones#
Cuatro direcciones, cada una con sus restricciones reales y con una cosa que puedes probar esta semana. Seguir como estás es una opción legítima; solo tiene que ser una opción elegida.
Ser dueño de la evaluación, no del modelo
Cuando escribir el experimento se delega y leerlo no, la posición escasa es la que decide qué cuenta como resultado. Diseñar evaluaciones es además la parte que las propias publicaciones del campo señalan como rezagada: las capacidades fáciles de medir mejoran más rápido que las difíciles, lo que es una afirmación de que los instrumentos de medida son el cuello de botella.
El trabajo de evaluación se juzga por cada cuánto dice que no, en organizaciones que miden el progreso por lanzamientos. Es además el trabajo que más probablemente se le entrega a alguien júnior precisamente porque parece infraestructura.
Toma el último resultado que celebró tu equipo e intenta producirlo por una vía que no debería funcionar. Si no te acercas, el resultado es más fuerte de lo que creías; si te acercas, has encontrado algo que nadie buscaba.
Convertirte en quien lleva muchas líneas a la vez
El desplazamiento medido va hacia investigadores sosteniendo varias sesiones de agente simultáneas, y el modo de fallo que se reporta no es que el agente sea incapaz sino que la persona no nota dónde se torció. Eso es una destreza de supervisión sin ninguna vía de formación establecida, que es justo por lo que tenerla pronto vale algo.
Cambia profundidad por amplitud en una etapa de la carrera en la que la profundidad es lo que hace que te contraten, y la propia publicación señala que dirigir se vuelve más difícil según se alargan las tareas. Depende además de un presupuesto de cómputo que la mayoría no controla.
Corre dos tareas de agente en paralelo durante una tarde y escribe, para cada intervención, la señal exacta que te dijo que entraras. Si la lista está vacía, no estabas supervisando, estabas esperando.
Irte a donde la restricción es el criterio
Los campos donde un experimento es caro, lento o irreversible — biología, materiales, medicina, hardware — no pueden delegar la ejecución a un agente, así que todo el valor está en elegir qué experimento hacer. Las destrezas de método se transfieren; la baratura que hizo delegable la fase de construcción de esta ocupación no existe allí.
Significa volver a empezar en un conocimiento de dominio que lleva años, y el tiempo de ciclo que protege el trabajo frena también tu propio aprendizaje al ritmo de los experimentos.
Busca a alguien de un campo así y pregúntale cuánto tardó su último experimento y cuánto costaba equivocarse. Compáralo con tu última semana. La distancia es lo que estarías comprando.
Preguntas frecuentes#
Ningún año, y en esta ocupación un año sería especialmente deshonesto, porque quienes están mejor colocados para saberlo discrepan entre sí en público. Lo que puedes medir tú es más útil. Sobre tus últimos diez trabajos, cuenta cuántos acabaron en código que escribiste y cuántos en un juicio sobre trabajo que produjo otra cosa. Después cuenta, entre las tareas de agente que salieron bien, cuántas tuviste que interrumpir. La primera proporción te dice qué mitad de este trabajo tienes ahora; la segunda te dice si la mitad que tienes sigue soportando carga. Los dos números están en tu propia semana y ninguno necesita la predicción de nadie.
Trata la declaración y la medición como dos cosas distintas, porque se publican en documentos distintos y solo una es comprobable. Las mediciones — jornadas-agente por jornada humana, tasas de intervención, la proporción de salida que es planificación de alto nivel — son concretas, datadas, y una publicación posterior podría contradecirlas. Las expectativas sobre lo que viene son expectativas: vienen de gente con una visibilidad inusual y un interés inusual, y las dos cosas cortan en la misma dirección. Este sitio registra lo primero y no lo segundo, y eso es un límite deliberado y no una opinión sobre quién tiene razón.
La pregunta se hace normalmente como si el doctorado fuera formación en construir cosas, y en su mayor parte no lo es. En lo que un doctorado son cuatro años de práctica es justo en la tarea que esta página marca como que se queda con las personas: decidir qué merece investigarse, y defender una afirmación sobre un resultado delante de gente que intenta romperla. Esa es la mitad escasa. La advertencia honesta es distinta de la habitual: la mitad barata del trabajo es donde un estudiante se demuestra hoy ante un comité de contratación, y si un programa solo te forma para eso, la formación y el mercado se han separado. Pregúntale al grupo al que te unes cada cuánto se desmonta el resultado de un estudiante delante de él, y cuándo fue la última vez que allí se abandonó una dirección.
No, y el sitio los mantiene separados a propósito porque su exposición difiere. Un ingeniero de aprendizaje automático entrega un sistema que corre sobre personas reales, y lo que desplazó buena parte de ese trabajo fue un sustituto comprable — un modelo que entrenó otro. Un investigador entrega una conclusión, y lo que allí se delega es el trabajo de producir evidencia para ella, no la conclusión. Una consecuencia importa para quien esté eligiendo: el desplazamiento del ingeniero es reversible, porque el precio o la licencia de un proveedor pueden moverse; el del investigador no tiene esa forma en absoluto. Si tu trabajo termina cuando algo sale a producción, lee mejor la página de ingeniero de aprendizaje automático.
Escrito sobre esto#
Estos textos argumentan a partir de los mismos registros que tiene esta página, y cada una de sus secciones nombra aquello en lo que se apoya.
Método y fuentes#
- Fecha de la evaluación
- 2026-09-13
- Base de los juicios de tarea
- 5 con evidencia · 1 inferencia de la plataforma · 0 sin evidencia suficiente
- Hechos verificados
- 5