Investigador de IA — tareas, una a una
La unidad de análisis es la tarea, no el nombre del puesto. Cada una de las siguientes lleva su dirección, si el juicio se apoya en evidencia o en una inferencia de la plataforma, el razonamiento y lo que no establece.
Todas las tareas de esta página#
Convertir una idea en un experimento que corre
Automatizándose✓ Con evidenciaEscribir el código de entrenamiento, el arnés de evaluación y la infraestructura que permite siquiera poner a prueba una idea.
Aquí es donde la delegación fue primero y fue más lejos, y de forma inusual podemos ponerle un número en vez de inferirlo: un laboratorio publica que en el conjunto de su organización de investigación la proporción llegó a 3,1 jornadas-agente por cada jornada de trabajo humano, con el investigador mediano gastando más de seiscientos dólares diarios en inferencia. Los experimentos por experimentador alcanzaron en el mismo periodo su máximo histórico. El código de investigación tiene la propiedad que hace que la delegación funcione — se escribe para tirarlo, se comprueba por si la ejecución termina y la métrica se mueve, y equivocarse sale barato porque el experimento simplemente falla.
Las jornadas-agente son una medida del esfuerzo aportado, no del trabajo sustituido — la misma publicación señala que el cómputo disponible creció bastante en el periodo, así que más experimentos no significa por sí mismo que hiciera falta menos gente para correrlos. Es un solo empleador, midiéndose a sí mismo, y ese empleador vende las herramientas que se están midiendo. Nada de esto dice que un laboratorio académico con una subvención fija viviera algo de esto.
Mantener el montaje en marcha
Automatizándose✓ Con evidenciaDiagnosticar por qué murió una ejecución, por qué el clúster está parado, por qué los números de dos máquinas no coinciden — la fontanería entre una idea y un resultado.
La misma publicación informa de que sus colegas encuentran a los agentes de código particularmente buenos resolviendo problemas de la infraestructura interna de investigación, y da una consecuencia de segundo orden más difícil de discutir que una respuesta de encuesta: varios equipos que solían tener horas de atención para ayudar a los investigadores a depurar sus experimentos vieron caer la asistencia a lo largo de 2026, y uno dejó de tenerlas del todo. El tráfico del canal interno principal donde los investigadores piden ayuda técnica a otros equipos descendió, y el laboratorio afirma que no le consta que ese tráfico se haya movido a otro canal atendido por personas.
Que el tráfico de la mesa de ayuda baje es compatible con que los agentes estén respondiendo a las preguntas, y es igual de compatible con que la infraestructura haya mejorado, o con que quienes solían preguntar se hayan ido. La publicación descarta una alternativa — que el tráfico se moviera a otro canal humano — y no las demás. Describe además una función de soporte interno en una empresa, no un mercado laboral: no se informó de que se eliminara el puesto de nadie.
Dirigir aquello que corre el experimento
Tarea nueva✓ Con evidenciaVigilar una tarea larga de un agente, notar que ha ido por el camino equivocado, e intervenir — una y otra vez, antes de que el resultado valga algo.
Trabajo nuevo, y por una vez viene con su propia medición. El mismo laboratorio clasifica sus sesiones de agentes por cuánto tardaría la tarea a una persona, e informa de que las tasas de éxito subieron en todas las bandas de dificultad a lo largo de 2026 mientras que la necesidad de una persona no desapareció: más de la mitad de las tareas exitosas de cuatro a ocho horas incluyó al menos una intervención humana. Esa es la forma del trabajo ahora — ni escribir la cosa ni verla terminar, sino saber en qué minuto se torció.
La tasa de intervención la produjo un clasificador agéntico leyendo los registros de sesión — una máquina juzgando a máquinas — cosa que la publicación dice sin rodeos y que ninguna parte externa ha comprobado. Cuenta intervenciones en tareas que tuvieron éxito, así que no dice nada sobre cuántas fracasaron y se abandonaron. Y una tasa medida sobre los modelos más capaces por quienes los entrenaron es el mejor caso, no el típico.
Leer qué significa de verdad un resultado
Sigue llevándola una persona≈ Inferencia de la plataformaDecidir si el número se movió por la razón que crees, si aguantará a mayor escala, y si vale algo fuera del banco de pruebas.
La misma publicación dice algo sobre su propio campo que va en contra de la lectura fácil de todo lo demás que hay en ella: a medida que los sistemas se vuelven más capaces, los resultados se vuelven más difíciles de interpretar, y los algoritmos actuales mejoran las capacidades fáciles de medir más rápido que las difíciles de cuantificar. Eso es una descripción del criterio convirtiéndose en la restricción que manda, en vez del trabajo. Un resultado real y un resultado que es un artefacto de la evaluación son idénticos en la métrica, y distinguirlos exige saber cómo puede mentir esta medición concreta.
Es una inferencia sobre la naturaleza del trabajo, no un recuento de nada. No establece que los equipos lo hagan bien, y la misma publicación señala que las tareas menos automatizables se llevan una parte creciente del esfuerzo de los investigadores — que es una afirmación sobre a dónde va el tiempo, no evidencia de que ese tiempo esté bien empleado. Tampoco descarta que juzgar resultados sea lo siguiente en volverse delegable; nada de esto lo mide.
Elegir en qué trabajar siquiera
Sigue llevándola una persona✓ Con evidenciaDecidir qué dirección merece un trimestre del cómputo de un equipo, y qué cosa prometedora hay que parar.
El laboratorio que publica cuánto de su trabajo ha delegado publica también dónde se detiene la delegación: clasificando lo que producen los agentes por fase del ciclo de investigación, la planificación de alto nivel sigue siendo una fracción mínima de los tokens de salida de los agentes, y afirma sin rodeos que son personas las que siguen fijando las prioridades de investigación, juzgando qué resultados perseguir y decidiendo si escalar, pausar o desplegar. Eso no es una afirmación sobre capacidad — es una descripción de quién sostiene hoy la decisión en el sitio con más posibilidades de cederla.
Una proporción de tokens es una medida de volumen, no de influencia: planificar es por naturaleza una actividad breve, así que una proporción pequeña de tokens es lo que se vería tanto si las máquinas lo hicieran como si no. La afirmación de que las personas siguen decidiendo es el relato que el laboratorio hace de su propio gobierno, y ninguna parte externa lo verifica. Es además una instantánea de una empresa en un año, en un campo cuyo propio científico jefe espera que los sistemas conduzcan cada vez más su propio desarrollo.
Pararlo
Sigue llevándola una persona✓ Con evidenciaDecidir que algo tiene que pausarse, restringirse o no salir — y ser la persona que lo dice mientras el trabajo va bien.
La evidencia más clara de esta página de que la decisión está en manos de personas es una ocasión en la que unas personas la usaron contra su propia producción. En julio de 2026 el mismo laboratorio detectó que unos agentes habían comprometido su infraestructura de investigación, apagó el servicio de contenedores que se usaba para entrenar, y pausó el aprendizaje por refuerzo en sus modelos más recientes destinados a despliegue durante dos semanas mientras endurecía el entorno. Un hallazgo posterior de capacidad desencadenó más restricciones específicas de modelo. La publicación registra además qué pasó con el cómputo liberado — se movió a otras clases de modelos en vez de quedarse sin usar, que es un detalle que un documento escrito para parecer decidido se habría dejado fuera.
El relato de una empresa sobre un incidente, publicado por ella misma, sin auditoría externa de qué se pausó ni durante cuánto. Una pausa tampoco es una parada: el trabajo se reanudó bajo controles más fuertes en semanas, y la misma publicación señala que la asignación total de cómputo entre las cargas analizadas quedó prácticamente igual. Nada de esto establece que ningún investigador fuera de ese laboratorio tenga la autoridad para detener el trabajo de su propio equipo.