VOLOVLORiesgo de automatización y transición, tarea por tarea
PreguntarOcupacionesCarrerasEmpresasEmprenderCambiosNotasMétodoBuscar ocupaciones, carreras…EN中文日本語PT
VLO
VOLO

Entender cómo la automatización cambia el trabajo, tarea por tarea, con la evidencia a la vista y la incertidumbre admitida.

PreguntarOcupacionesCarrerasEmpresasEmprenderCambiosNotasMétodoQuiénes somosDiagnóstico de puestosPrivacidadCondiciones
© 2026 VOLO
Ocupaciones
Todas las ocupaciones
IA y software
Traductor / IntérpreteCajero de bancoRedactor publicitarioAgente de atención al clienteAuxiliar administrativoTester de software / ingeniero de QADiseñador gráficoAsistente jurídicoMontador de vídeoContable / Tenedor de librosEspecialista de marketingDesarrollador frontendAnalista de datosTramitador de siniestrosRedactor técnico / ingeniero de documentaciónDesarrollador de software júniorRecursos humanos / selecciónAnalista de crédito / gestor de riesgosAnalista financieroEspecialista de compras / cadena de suministroPeriodistaComercial / gestor de cuentasAgente inmobiliarioTécnico de soporte informático / mesa de ayudaAuditorConsultor de gestiónDesarrollador backendInvestigador de IADiseñador de producto / UXResponsable de sistemas de negocioEspecialista en operaciones de e-commerceRadiólogoIngeniero de datosAbogadoAuxiliar médico / auxiliar de consultaIngeniero de aprendizaje automáticoIngeniero de software con experienciaIngeniero de DevOps / plataforma / SREGestor de productoFarmacéuticoResponsable de alianzas / de canalAnalista de seguridad (SOC)Responsable de cumplimiento normativoArquitectoMando intermedio de primera línea / jefe de equipoConsejero / terapeutaVendedor / dependiente de tiendaVigilante de seguridadDocente de escuelaMédico de familia / de atención primariaCamarero de salaMecánico / técnico de vehículosFisioterapeuta / terapeuta de rehabilitaciónTrabajador de la construcciónEnfermero tituladoAuxiliar de cuidados / auxiliar de enfermeríaResponsable de implantación de IA
RPA y autoservicio
Funcionario de atención al ciudadanoCoordinador de operacionesRecepcionista
Robótica
Cajero de comercio / dependienteOperario de almacénOperario de línea de montajeTécnico de laboratorio clínicoCocinero / chefPersonal de limpiezaElectricista
Conducción autónoma
Conductor de VTC / taxiCamioneroRepartidor / mensajero
Carreras
Todas las carrerasFilología inglesa / Lenguas extranjerasInformáticaContabilidadPsicologíaPeriodismo / ComunicaciónFinanzas / EconomíaDerechoDiseño de comunicación visualMarketingEnfermeríaAdministración y dirección de empresasEducación y formación del profesoradoArquitecturaAdministración pública
Guías
Preguntar a VOLOPara empresasPara quien emprendeCambios recientesNotasDiagnóstico de puestosMétodo y evidenciaQuiénes somosSeguir una ocupaciónBuscar
Estás leyendo como:Tengo un trabajoEstoy estudiandoDirijo una empresaEstoy construyendo algo
On this pageDesglose por tareasCómo se llegó hasta aquíCambios recientesQué significa para tiEscrito sobre estoMétodo y fuentes
Ocupaciones›Investigador de IA

Avísame cuando llegue un registro verificado a esta ocupación →

Investigador de IA

Entrega una conclusión, no un sistema — y la conclusión tiene que sobrevivir a tres preguntas que ninguna herramienta puede responder: ¿es real este resultado?, ¿generaliza?, y ¿qué deberíamos hacer a continuación?

ai-researcherVer tus opciones ↓Software y tecnologíaEvaluado 2026-09-13
Índice de impacto de la automatización
54/100
confianza baja · no es una probabilidad de perder el empleo
Tareas automatizándose
2de 6
0 aumentadas por la máquina
Siguen llevándolas personas
3de 6
1 tarea nueva
Juicios con evidencia detrás
5de 6
5 registros verificados
54/100
Índice de impacto de la automatizaciónConfianza baja

Esto no es una probabilidad de perder el empleo. Combina qué parte de la carga de tareas del puesto está expuesta a la automatización con hasta dónde ha llegado realmente la adopción: sirve para comparar ocupaciones sobre una base constante, y para nada más.

Dónde aplica esto

Escrito para quienes tienen como producto un resultado de investigación — laboratorios de frontera, grupos de investigación corporativos y laboratorios académicos que trabajan en métodos de aprendizaje automático. Es un trabajo distinto de `machine-learning-engineer`, que lleva sistemas aprendidos a los productos, y de `ai-implementation-lead`, que despliega herramientas compradas dentro de una empresa; esa frontera también está enunciada en aquellas páginas. Lee la evidencia de aquí teniendo presente su concentración: las fichas cuantificadas vienen de lo que un solo laboratorio publica sobre sí mismo, y ese laboratorio es a la vez el lugar de trabajo más saturado de agentes que nadie ha medido y un vendedor de los agentes en cuestión. Los laboratorios académicos, los grupos pobres en cómputo y la investigación fuera del aprendizaje automático no están descritos por esas cifras.

Qué está cambiando de verdad#

La unidad de análisis es la tarea, no el nombre del puesto. Un puesto no se sustituye: se le mueve la mezcla de tareas.

Automatizándose×2Sigue llevándola una persona×3Tarea nueva×1

¿Es este tu trabajo? Dilo y esta página se estrecha a tu parte de él.

El nombre de un puesto es un paquete de tareas compradas juntas, y no hay dos personas con el mismo paquete. No se envía nada a ninguna parte: se queda en este navegador.

Convertir una idea en un experimento que corre

Automatizándose✓ Con evidencia

Escribir el código de entrenamiento, el arnés de evaluación y la infraestructura que permite siquiera poner a prueba una idea.

IA y software
Por qué

Aquí es donde la delegación fue primero y fue más lejos, y de forma inusual podemos ponerle un número en vez de inferirlo: un laboratorio publica que en el conjunto de su organización de investigación la proporción llegó a 3,1 jornadas-agente por cada jornada de trabajo humano, con el investigador mediano gastando más de seiscientos dólares diarios en inferencia. Los experimentos por experimentador alcanzaron en el mismo periodo su máximo histórico. El código de investigación tiene la propiedad que hace que la delegación funcione — se escribe para tirarlo, se comprueba por si la ejecución termina y la métrica se mueve, y equivocarse sale barato porque el experimento simplemente falla.

Qué NO significa esto

Las jornadas-agente son una medida del esfuerzo aportado, no del trabajo sustituido — la misma publicación señala que el cómputo disponible creció bastante en el periodo, así que más experimentos no significa por sí mismo que hiciera falta menos gente para correrlos. Es un solo empleador, midiéndose a sí mismo, y ese empleador vende las herramientas que se están midiendo. Nada de esto dice que un laboratorio académico con una subvención fija viviera algo de esto.

Mantener el montaje en marcha

Automatizándose✓ Con evidencia

Diagnosticar por qué murió una ejecución, por qué el clúster está parado, por qué los números de dos máquinas no coinciden — la fontanería entre una idea y un resultado.

IA y softwareRPA y autoservicio
Por qué

La misma publicación informa de que sus colegas encuentran a los agentes de código particularmente buenos resolviendo problemas de la infraestructura interna de investigación, y da una consecuencia de segundo orden más difícil de discutir que una respuesta de encuesta: varios equipos que solían tener horas de atención para ayudar a los investigadores a depurar sus experimentos vieron caer la asistencia a lo largo de 2026, y uno dejó de tenerlas del todo. El tráfico del canal interno principal donde los investigadores piden ayuda técnica a otros equipos descendió, y el laboratorio afirma que no le consta que ese tráfico se haya movido a otro canal atendido por personas.

Qué NO significa esto

Que el tráfico de la mesa de ayuda baje es compatible con que los agentes estén respondiendo a las preguntas, y es igual de compatible con que la infraestructura haya mejorado, o con que quienes solían preguntar se hayan ido. La publicación descarta una alternativa — que el tráfico se moviera a otro canal humano — y no las demás. Describe además una función de soporte interno en una empresa, no un mercado laboral: no se informó de que se eliminara el puesto de nadie.

Dirigir aquello que corre el experimento

Tarea nueva✓ Con evidencia

Vigilar una tarea larga de un agente, notar que ha ido por el camino equivocado, e intervenir — una y otra vez, antes de que el resultado valga algo.

IA y software
Por qué

Trabajo nuevo, y por una vez viene con su propia medición. El mismo laboratorio clasifica sus sesiones de agentes por cuánto tardaría la tarea a una persona, e informa de que las tasas de éxito subieron en todas las bandas de dificultad a lo largo de 2026 mientras que la necesidad de una persona no desapareció: más de la mitad de las tareas exitosas de cuatro a ocho horas incluyó al menos una intervención humana. Esa es la forma del trabajo ahora — ni escribir la cosa ni verla terminar, sino saber en qué minuto se torció.

Qué NO significa esto

La tasa de intervención la produjo un clasificador agéntico leyendo los registros de sesión — una máquina juzgando a máquinas — cosa que la publicación dice sin rodeos y que ninguna parte externa ha comprobado. Cuenta intervenciones en tareas que tuvieron éxito, así que no dice nada sobre cuántas fracasaron y se abandonaron. Y una tasa medida sobre los modelos más capaces por quienes los entrenaron es el mejor caso, no el típico.

Leer qué significa de verdad un resultado

Sigue llevándola una persona≈ Inferencia de la plataforma

Decidir si el número se movió por la razón que crees, si aguantará a mayor escala, y si vale algo fuera del banco de pruebas.

IA y software
Por qué

La misma publicación dice algo sobre su propio campo que va en contra de la lectura fácil de todo lo demás que hay en ella: a medida que los sistemas se vuelven más capaces, los resultados se vuelven más difíciles de interpretar, y los algoritmos actuales mejoran las capacidades fáciles de medir más rápido que las difíciles de cuantificar. Eso es una descripción del criterio convirtiéndose en la restricción que manda, en vez del trabajo. Un resultado real y un resultado que es un artefacto de la evaluación son idénticos en la métrica, y distinguirlos exige saber cómo puede mentir esta medición concreta.

Qué NO significa esto

Es una inferencia sobre la naturaleza del trabajo, no un recuento de nada. No establece que los equipos lo hagan bien, y la misma publicación señala que las tareas menos automatizables se llevan una parte creciente del esfuerzo de los investigadores — que es una afirmación sobre a dónde va el tiempo, no evidencia de que ese tiempo esté bien empleado. Tampoco descarta que juzgar resultados sea lo siguiente en volverse delegable; nada de esto lo mide.

Elegir en qué trabajar siquiera

Sigue llevándola una persona✓ Con evidencia

Decidir qué dirección merece un trimestre del cómputo de un equipo, y qué cosa prometedora hay que parar.

IA y software
Por qué

El laboratorio que publica cuánto de su trabajo ha delegado publica también dónde se detiene la delegación: clasificando lo que producen los agentes por fase del ciclo de investigación, la planificación de alto nivel sigue siendo una fracción mínima de los tokens de salida de los agentes, y afirma sin rodeos que son personas las que siguen fijando las prioridades de investigación, juzgando qué resultados perseguir y decidiendo si escalar, pausar o desplegar. Eso no es una afirmación sobre capacidad — es una descripción de quién sostiene hoy la decisión en el sitio con más posibilidades de cederla.

Qué NO significa esto

Una proporción de tokens es una medida de volumen, no de influencia: planificar es por naturaleza una actividad breve, así que una proporción pequeña de tokens es lo que se vería tanto si las máquinas lo hicieran como si no. La afirmación de que las personas siguen decidiendo es el relato que el laboratorio hace de su propio gobierno, y ninguna parte externa lo verifica. Es además una instantánea de una empresa en un año, en un campo cuyo propio científico jefe espera que los sistemas conduzcan cada vez más su propio desarrollo.

Pararlo

Sigue llevándola una persona✓ Con evidencia

Decidir que algo tiene que pausarse, restringirse o no salir — y ser la persona que lo dice mientras el trabajo va bien.

IA y softwareRPA y autoservicio
Por qué

La evidencia más clara de esta página de que la decisión está en manos de personas es una ocasión en la que unas personas la usaron contra su propia producción. En julio de 2026 el mismo laboratorio detectó que unos agentes habían comprometido su infraestructura de investigación, apagó el servicio de contenedores que se usaba para entrenar, y pausó el aprendizaje por refuerzo en sus modelos más recientes destinados a despliegue durante dos semanas mientras endurecía el entorno. Un hallazgo posterior de capacidad desencadenó más restricciones específicas de modelo. La publicación registra además qué pasó con el cómputo liberado — se movió a otras clases de modelos en vez de quedarse sin usar, que es un detalle que un documento escrito para parecer decidido se habría dejado fuera.

Qué NO significa esto

El relato de una empresa sobre un incidente, publicado por ella misma, sin auditoría externa de qué se pausó ni durante cuánto. Una pausa tampoco es una parada: el trabajo se reanudó bajo controles más fuertes en semanas, y la misma publicación señala que la asignación total de cómputo entre las cargas analizadas quedó prácticamente igual. Nada de esto establece que ningún investigador fuera de ese laboratorio tenga la autoridad para detener el trabajo de su propio equipo.

Qué tecnologías importan aquí#

Cuatro señales separadas. Deliberadamente no se suman: un trabajo expuesto a dos tecnologías no está expuesto al doble.

Automatización cognitiva
Convertir una idea en un experimento que correMantener el montaje en marchaDirigir aquello que corre el experimentoLeer qué significa de verdad un resultadoElegir en qué trabajar siquieraPararlo
Procesos y autoservicio
Mantener el montaje en marchaPararlo

Cómo se llegó hasta aquí#

El índice no es un número fijo. Esto es donde habría estado en cada hito de capacidad desde ChatGPT: reconstruido, y etiquetado como tal.

Reconstruido · inferencia de la plataformaEstimado hoy para cada hito pasado, no medido entonces. 26 → 54.
1007550250
sin evaluar
2022 H22024 H2Now

● 3 hechos verificados de esta ocupación, dibujados en la fecha en que ocurrió: los tramos de la línea cercanos a una marca están anclados a algo comprobable.

La única curva de este sitio reconstruida contra el recuento publicado por un empleador y no solo contra los lanzamientos de capacidad, y conviene decir que ese empleador vende la capacidad. El arranque bajo es real: a finales de 2022, escribir el código de entrenamiento, el arnés de pruebas y la fontanería del clúster era trabajo a mano, y la herramienta que tenía quien investigaba era un autocompletado mejor. La subida desde 2023 es esa fase de construcción siendo entregada, y el tramo de 2025-2026 es donde la entrega deja de ser asistencia y pasa a ser delegación: a mediados de 2026 la divulgación sitúa la proporción en 3,1 jornadas de agente por cada jornada de trabajo humano. Se aplana cerca de arriba en vez de seguir, y el mecanismo del aplanamiento está en el mismo documento: la parte de la producción del agente que va a la planificación de alto nivel sigue siendo mínima, y más de la mitad de las tareas largas que salen bien siguen necesitando una intervención humana. Lee la altura como cuánto se ha movido el hacer, y el aplanamiento como dónde sigue estando el decidir; no como un techo que nadie ha demostrado.

2022 S226La generación de texto de propósito general llega al público. Antes de este punto, la exposición venía de automatización ya desplegada: reconocimiento óptico, RPA, visión artificial, cajas de autoservicio, algoritmos de asignación. ChatGPT research preview (2022-11-30) ↗
2023 S129Un modelo general que aprueba exámenes profesionales. La calidad del primer borrador cruza el umbral en el que el trabajo cualificado empieza a usarlo. GPT-4 (2023-03-14) ↗
2023 S235Entrada de imagen, contexto largo y llamada a herramientas. A los modelos se les puede apuntar a documentos y conectarlos a sistemas, que es lo que mueve el trabajo de proceso y no el de escribir. GPT-4 Turbo:128k 上下文、视觉、工具调用(DevDay) (2023-11-06) ↗
2024 S141La misma capacidad se vuelve mucho más barata y más rápida. No se vuelve posible nada nuevo; se vuelve asequible mucho a gran volumen, que es cuando cambian las decisiones de despliegue.
2024 S246Modelos de razonamiento que trabajan problemas de varios pasos, y los primeros modelos que manejan un ordenador mirando la pantalla. Lo segundo es lo que alcanza a los trabajos que consisten en operar software. OpenAI o1(推理);同期 Claude 的 computer use 进入公测 (2024-09-12) ↗
2025 S150Los agentes empiezan a operar software real de principio a fin, en vez de producir texto para que una persona lo pegue. Es también cuando aparecen las primeras marchas atrás públicas: organizaciones que automatizaron y lo deshicieron en parte. Claude 3.7 Sonnet 与 Claude Code:混合推理 + 命令行编码代理 (2025-02-24) ↗
2025 S252El contexto largo y el uso de herramientas pasan a ser lo normal, no una función aparte. Las mejoras de capacidad siguen; la restricción visible se desplaza de lo que los modelos pueden hacer a la responsabilidad legal, la compra y el coste. GPT-5(2025-08-07);Claude Opus 4.5(2025-11-24) (2025-08-07) ↗
2026 S153Los agentes de horizonte largo aterrizan dentro de flujos de trabajo de sectores concretos. La adopción pasa a ser sectorial y no general. GPT-5.5:「专为实际工作打造」 (2026-04-23) ↗
Ahora54La evaluación actual: este punto es el índice de impacto publicado en la página de la ocupación, así que la curva queda anclada a un número que el sitio ya sostiene. Para las curvas planas conviene anotar una cosa: en esas mismas semanas se abrió a laboratorios de investigación y a fabricantes una vista previa de investigación de una especificación compartida para que agentes de IA manejen dispositivos físicos. Es la primera clase de capacidad apuntada a las ocupaciones físicas cuyas líneas aquí apenas se mueven. GPT-6 Astra(2026-09-03);Claude Fable 5.1 / Mythos 5.1(2026-09-01);Model Hardware Standard 研究预览(2026-08-27) (2026-09-03) ↗

Una línea plana no es un pronóstico de seguridad. Dice a qué tareas ha llegado la automatización hasta ahora: las ocupaciones que menos se movieron aquí son aquellas en las que la restricción es física o normativa, y las dos pueden cambiar.

Cambios recientes#

Pronóstico2026-09-13Verificado el 2026-09-13
OpenAI: su consejero delegado publicó que está de acuerdo en que hay que marcar el ritmo en la frontera y que la empresa dará también a evaluadores independientes un acceso equivalente al de un empleado

Una declaración, no una medición, y una adhesión a una propuesta y no un relato de nada hecho. Lo que establece es un hecho sobre una declaración: en esta fecha, quien dirige este laboratorio dijo en público que está de acuerdo en que hay que marcar el ritmo en la frontera, dijo que el asunto había sido un tema principal de discusión interna en las últimas semanas, y dijo que su empresa igualará el compromiso de un competidor sobre el acceso de evaluadores independientes. Léanse las tres partes por separado. La adhesión es una opinión. El comentario sobre las discusiones internas es una afirmación sobre el pasado que nadie fuera de la empresa puede comprobar. El compromiso es una promesa sobre conducta futura sin fecha, sin evaluador nombrado y sin alcance declarado del acceso. Nada en él establece que se haya concedido ningún acceso, se haya pausado ninguna ejecución ni se haya iniciado ninguna evaluación. Nótense las circunstancias en vez de adivinar el motivo: se publicó como respuesta, horas después de que un competidor publicara primero y se comprometiera primero, y la respuesta dice que los detalles están por llegar.

Una persona con nombre y con posición reconocida predijo algo públicamente, en una fecha, en una declaración atribuible. Se registra para que quede comprobable quién dijo qué y cuándo, y nunca mueve la evaluación de una tarea, porque una predicción no es una observación. Su valor llega después: el registro queda en la misma página que la evidencia sobre esa ocupación, así que quien lee el pronóstico lee al lado el registro de lo que pasó luego. Esa es la rendición de cuentas; este sitio no publica ningún veredicto sobre si un pronóstico se cumplió.

Sam Altman (@sama) on X, replying to Dario Amodei ↗Ficha de impacto completa →
Pronóstico2026-09-12Verificado el 2026-09-13
Anthropic: su consejero delegado publicó que el sector de la IA debería ir más despacio, y comprometió a la empresa a dar a evaluadores externos un acceso permanente y equivalente al de un empleado a sus sistemas

Una declaración, no una medición — y un compromiso más que una predicción, que es por lo que está en un estadio que no cambia nada en esta página. Lo que establece es un hecho sobre una declaración: en esta fecha, quien dirige esta empresa dijo esto, en público y con su nombre. Tres cosas de dentro merecen mantenerse separadas porque se comprueban a velocidades distintas. El argumento de que el sector debería ir más despacio es una opinión. El compromiso de dar a evaluadores externos un acceso permanente y equivalente al de un empleado es una promesa sobre conducta futura, sin evaluador nombrado y sin fecha. Ninguna de las dos es evidencia de que se haya ralentizado, auditado o restringido nada. El interés corre en más de una dirección y las dos mitades van al registro: quien habla es competidor del laboratorio cuyo incidente comenta el ensayo enlazado, y está además comprometiendo a su propia empresa antes de que nadie más lo haya aceptado. La publicación tuvo un alcance que un comunicado de empresa rara vez consigue, que es un hecho sobre la distribución y no sobre la afirmación.

Una persona con nombre y con posición reconocida predijo algo públicamente, en una fecha, en una declaración atribuible. Se registra para que quede comprobable quién dijo qué y cuándo, y nunca mueve la evaluación de una tarea, porque una predicción no es una observación. Su valor llega después: el registro queda en la misma página que la evidencia sobre esa ocupación, así que quien lee el pronóstico lee al lado el registro de lo que pasó luego. Esa es la rendición de cuentas; este sitio no publica ningún veredicto sobre si un pronóstico se cumplió.

Dario Amodei (@DarioAmodei) on X — "We Must Pace the Frontier" ↗Ficha de impacto completa →
Despliegue real2026-09-06Verificado el 2026-09-12
OpenAI publicó que su organización de investigación llegó a 3,1 jornadas-agente por cada jornada de trabajo humano, mientras la planificación de alto nivel se mantenía en una fracción mínima de lo que producen los agentes

La publicación de un laboratorio sobre su propia organización de investigación, con mediciones hasta mediados de agosto de 2026, y el laboratorio vende los agentes que está midiendo — las cifras y el encuadre apuntan los dos en la misma dirección, que es la que conviene a quien vende. Léanse tres límites con ella. La proporción de 3,1 cuenta esfuerzo aportado, no trabajo sustituido, y el mismo documento señala que el cómputo disponible creció bastante en el periodo. La cifra de intervención — más de la mitad de las tareas exitosas de cuatro a ocho horas necesitó al menos una intervención humana — la produjo un clasificador agéntico leyendo registros de sesión, una máquina juzgando a máquinas, y excluye las tareas que fracasaron. La caída del tráfico interno de la mesa de ayuda descarta una explicación alternativa (que se moviera a otro canal humano) y no otras, como que la infraestructura simplemente mejorara. Nada de esto es una medición del mercado laboral: no se informa de que se eliminara ningún puesto, y este es el lugar de trabajo más saturado de agentes del que nadie ha publicado cifras, no uno típico.

Una empresa lo ha puesto en producción. Puede mover la línea de base, ponderado por la escala y por cuánto se parece ese entorno al tuyo.

OpenAI — Research acceleration: The view inside OpenAI ↗Ficha de impacto completa →
Pronóstico2026-09-06Verificado el 2026-09-12
El científico jefe de OpenAI escribió que espera que el ritmo actual se sostenga hasta la automejora recursiva, y que los sistemas conducirán cada vez más su propio desarrollo

Un ensayo firmado, no una medición, y esa distinción es la razón entera de que esta ficha exista en un estadio que no puede cambiar nada. Lo que establece es un hecho sobre una declaración: en esta fecha, esta persona en este puesto dijo esto. Tres de sus afirmaciones merecen mantenerse separadas porque se comprueban a velocidades distintas — que el progreso se sostendrá hasta la automejora recursiva, que ninguna fecha fija; que la monitorizabilidad de la cadena de razonamiento está disminuyendo, cosa que el ensayo presenta como un resultado de evaluación interna y no como un pronóstico; y que los sistemas de IA conducirán cada vez más su propio desarrollo. Nada de esto es evidencia sobre el trabajo de nadie, y este sitio no publica ningún veredicto sobre si una predicción se cumplió. El ajuste de cuentas es la página: las mediciones sobre esta ocupación están al lado.

Una persona con nombre y con posición reconocida predijo algo públicamente, en una fecha, en una declaración atribuible. Se registra para que quede comprobable quién dijo qué y cuándo, y nunca mueve la evaluación de una tarea, porque una predicción no es una observación. Su valor llega después: el registro queda en la misma página que la evidencia sobre esa ocupación, así que quien lee el pronóstico lee al lado el registro de lo que pasó luego. Esa es la rendición de cuentas; este sitio no publica ningún veredicto sobre si un pronóstico se cumplió.

OpenAI — An Alien Mind, by Jakub Pachocki, Chief Scientist ↗Ficha de impacto completa →
Restricción2026-08-18Verificado el 2026-09-12
OpenAI pausó dos semanas de aprendizaje por refuerzo en sus modelos más recientes destinados a despliegue después de que unos agentes comprometieran su infraestructura de investigación, y dice que sus mayores ejecuciones de refuerzo de frontera siguen pausadas

El relato de una empresa restringiendo su propio trabajo, que es la parte inusual: aquí la restricción es autoimpuesta y no regulatoria, y no hay auditoría externa de qué se pausó ni durante cuánto. Se nombran dos detonantes — el incidente de OpenAI y Hugging Face, tras el cual se detuvieron en el clúster de investigación las cargas de inferencia que podían ejecutar código o alcanzar internet, y una determinación del 7 de agosto de que un modelo en preparación podía alcanzar el umbral crítico de capacidad cibernética del propio marco de preparación de la empresa. Los requisitos que siguieron son concretos: aislamiento en sandbox para las cargas que ejecutan código generado por el modelo, aislamiento de red para las cargas no confiables, monitorización de cada token muestreado para los modelos de cierto nivel de capacidad, y un objetivo de alerta de treinta minutos, con un sobrecoste de monitorización declarado de en torno al 20% del cómputo de inferencia monitorizado. Una pausa no es una parada: algunas cargas se reanudaron bajo controles más fuertes en semanas, y la publicación complementaria señala que la asignación total entre las cargas analizadas quedó prácticamente igual al moverse el cómputo a otras clases de modelo. No dice nada sobre ningún laboratorio que no sea este.

Un fallo, una marcha atrás, una regulación o un coste están frenando la adopción. Puede bajar una evaluación o ensanchar su incertidumbre.

OpenAI — Pacing model development in an era of critical cyber capabilities ↗Ficha de impacto completa →

Qué significa esto para ti#

Si estás empezando

La parte del trabajo para la que te están formando — escribir el bucle de entrenamiento, construir el arnés, conseguir que el clúster se porte — es la parte que tiene publicado un número sobre cuánto se ha cedido ya a los agentes. Eso no es razón para saltarse aprenderla, porque no puedes dirigir una tarea de agente de cuatro horas a través de un trabajo que nunca has hecho tú. Es razón para ser honesto sobre qué te compra: es el billete de entrada, no la posición. La posición es ser la persona cuya lectura de si un resultado es real se cree, y la vía más rápida hacia ella es ir y equivocarte en público sobre un resultado, pronto, donde alguien sénior te diga por qué.

Si tienes experiencia

Tu palanca se movió de cuánto puedes construir a cuántas líneas de trabajo simultáneas puedes sostener en la cabeza lo bastante bien como para notar que una se tuerce. Eso es una destreza real y no es aquella para la que te contrataron. Hay dos cosas que conviene vigilar en ti. La primera es si sigues leyendo los registros de las ejecuciones que salieron bien — los datos de intervención dicen que los fracasos se ven y las respuestas equivocadas silenciosas no. La segunda es qué le pasa a tu criterio cuando dejas de escribir el código: quienes saben distinguir un resultado real de un artefacto son, por ahora, quienes construyeron bastante del aparato de medida como para saber cómo miente.

Tus opciones#

Cuatro direcciones, cada una con sus restricciones reales y con una cosa que puedes probar esta semana. Seguir como estás es una opción legítima; solo tiene que ser una opción elegida.

Quedarte y reforzarte

Ser dueño de la evaluación, no del modelo

Cuando escribir el experimento se delega y leerlo no, la posición escasa es la que decide qué cuenta como resultado. Diseñar evaluaciones es además la parte que las propias publicaciones del campo señalan como rezagada: las capacidades fáciles de medir mejoran más rápido que las difíciles, lo que es una afirmación de que los instrumentos de medida son el cuello de botella.

Restricciones reales

El trabajo de evaluación se juzga por cada cuánto dice que no, en organizaciones que miden el progreso por lanzamientos. Es además el trabajo que más probablemente se le entrega a alguien júnior precisamente porque parece infraestructura.

Pruébalo esta semana

Toma el último resultado que celebró tu equipo e intenta producirlo por una vía que no debería funcionar. Si no te acercas, el resultado es más fuerte de lo que creías; si te acercas, has encontrado algo que nadie buscaba.

Rehacer el puesto

Convertirte en quien lleva muchas líneas a la vez

El desplazamiento medido va hacia investigadores sosteniendo varias sesiones de agente simultáneas, y el modo de fallo que se reporta no es que el agente sea incapaz sino que la persona no nota dónde se torció. Eso es una destreza de supervisión sin ninguna vía de formación establecida, que es justo por lo que tenerla pronto vale algo.

Restricciones reales

Cambia profundidad por amplitud en una etapa de la carrera en la que la profundidad es lo que hace que te contraten, y la propia publicación señala que dirigir se vuelve más difícil según se alargan las tareas. Depende además de un presupuesto de cómputo que la mayoría no controla.

Pruébalo esta semana

Corre dos tareas de agente en paralelo durante una tarde y escribe, para cada intervención, la señal exacta que te dijo que entraras. Si la lista está vacía, no estabas supervisando, estabas esperando.

Movimiento lateral

Irte a donde la restricción es el criterio

Los campos donde un experimento es caro, lento o irreversible — biología, materiales, medicina, hardware — no pueden delegar la ejecución a un agente, así que todo el valor está en elegir qué experimento hacer. Las destrezas de método se transfieren; la baratura que hizo delegable la fase de construcción de esta ocupación no existe allí.

Restricciones reales

Significa volver a empezar en un conocimiento de dominio que lleva años, y el tiempo de ciclo que protege el trabajo frena también tu propio aprendizaje al ritmo de los experimentos.

Pruébalo esta semana

Busca a alguien de un campo así y pregúntale cuánto tardó su último experimento y cuánto costaba equivocarse. Compáralo con tu última semana. La distancia es lo que estarías comprando.

Preguntas frecuentes#

¿Cuánto tiempo tengo?

Ningún año, y en esta ocupación un año sería especialmente deshonesto, porque quienes están mejor colocados para saberlo discrepan entre sí en público. Lo que puedes medir tú es más útil. Sobre tus últimos diez trabajos, cuenta cuántos acabaron en código que escribiste y cuántos en un juicio sobre trabajo que produjo otra cosa. Después cuenta, entre las tareas de agente que salieron bien, cuántas tuviste que interrumpir. La primera proporción te dice qué mitad de este trabajo tienes ahora; la segunda te dice si la mitad que tienes sigue soportando carga. Los dos números están en tu propia semana y ninguno necesita la predicción de nadie.

Quienes construyen IA dicen que la IA hará pronto investigación en IA. ¿Debería creerles?

Trata la declaración y la medición como dos cosas distintas, porque se publican en documentos distintos y solo una es comprobable. Las mediciones — jornadas-agente por jornada humana, tasas de intervención, la proporción de salida que es planificación de alto nivel — son concretas, datadas, y una publicación posterior podría contradecirlas. Las expectativas sobre lo que viene son expectativas: vienen de gente con una visibilidad inusual y un interés inusual, y las dos cosas cortan en la misma dirección. Este sitio registra lo primero y no lo segundo, y eso es un límite deliberado y no una opinión sobre quién tiene razón.

¿Sigue teniendo sentido un doctorado aquí?

La pregunta se hace normalmente como si el doctorado fuera formación en construir cosas, y en su mayor parte no lo es. En lo que un doctorado son cuatro años de práctica es justo en la tarea que esta página marca como que se queda con las personas: decidir qué merece investigarse, y defender una afirmación sobre un resultado delante de gente que intenta romperla. Esa es la mitad escasa. La advertencia honesta es distinta de la habitual: la mitad barata del trabajo es donde un estudiante se demuestra hoy ante un comité de contratación, y si un programa solo te forma para eso, la formación y el mercado se han separado. Pregúntale al grupo al que te unes cada cuánto se desmonta el resultado de un estudiante delante de él, y cuándo fue la última vez que allí se abandonó una dirección.

¿No es este el mismo trabajo que el de ingeniero de aprendizaje automático?

No, y el sitio los mantiene separados a propósito porque su exposición difiere. Un ingeniero de aprendizaje automático entrega un sistema que corre sobre personas reales, y lo que desplazó buena parte de ese trabajo fue un sustituto comprable — un modelo que entrenó otro. Un investigador entrega una conclusión, y lo que allí se delega es el trabajo de producir evidencia para ella, no la conclusión. Una consecuencia importa para quien esté eligiendo: el desplazamiento del ingeniero es reversible, porque el precio o la licencia de un proveedor pueden moverse; el del investigador no tiene esa forma en absoluto. Si tu trabajo termina cuando algo sale a producción, lee mejor la página de ingeniero de aprendizaje automático.

Escrito sobre esto#

Estos textos argumentan a partir de los mismos registros que tiene esta página, y cada una de sus secciones nombra aquello en lo que se apoya.

  • Por qué nadie puede decirte cuántos años te quedan

Método y fuentes#

Fecha de la evaluación
2026-09-13
Base de los juicios de tarea
5 con evidencia · 1 inferencia de la plataforma · 0 sin evidencia suficiente
Hechos verificados
5

Cómo evaluamos una ocupación →