VOLOVLORisco de automatização e transição, tarefa a tarefa
PerguntarProfissõesCursosEmpresasEmpreenderMudançasNotasMétodoProcurar profissões, cursos…EN中文日本語ES
VLO
VOLO

Perceber como é que a automatização muda o trabalho, tarefa a tarefa, com a prova à vista e a incerteza assumida.

PerguntarProfissõesCursosEmpresasEmpreenderMudançasNotasMétodoQuem somosDiagnóstico de postosPrivacidadeCondições
© 2026 VOLO
Profissões
Todas as profissões
IA e software
Tradutor / IntérpreteCaixa de bancoCopywriterAssistente de apoio ao clienteAssistente administrativoTestador de software / engenheiro de QADesigner gráficoParalegalEditor de vídeoContabilista / Guarda-livrosEspecialista de marketingProgramador frontendAnalista de dadosGestor de sinistrosRedator técnico / engenheiro de documentaçãoProgramador de software júniorRecursos humanos / recrutamentoAnalista de crédito / gestor de riscoAnalista financeiroEspecialista de compras / cadeia de abastecimentoJornalistaComercial / gestor de contaAgente imobiliárioTécnico de suporte informático / helpdeskAuditorConsultor de gestãoProgramador backendInvestigador de IADesigner de produto / UXResponsável de sistemas de negócioEspecialista em operações de e-commerceRadiologistaEngenheiro de dadosAdvogadoAssistente médico / auxiliar de consultórioEngenheiro de aprendizagem automáticaEngenheiro de software experienteEngenheiro de DevOps / plataforma / SREGestor de produtoFarmacêuticoResponsável de parcerias / de canalAnalista de segurança (SOC)Responsável de conformidadeArquitetoChefe de primeira linha / chefe de equipaPsicoterapeuta / conselheiroVendedor / empregado de lojaSegurança / vigilanteProfessor do ensino básico e secundárioMédico de família / de cuidados primáriosEmpregado de mesaMecânico / técnico de automóveisFisioterapeuta / terapeuta de reabilitaçãoTrabalhador da construçãoEnfermeiroAuxiliar de ação direta / auxiliar de enfermagemResponsável de implementação de IA
RPA e autosserviço
Funcionário de atendimento ao públicoCoordenador de operaçõesRececionista
Robótica
Operador de caixa / empregado de lojaOperário de armazémOperário de linha de montagemTécnico de análises clínicasCozinheiro / chefPessoal de limpezaEletricista
Condução autónoma
Motorista de TVDE / táxiCamionistaEstafeta / entregador
Cursos
Todos os cursosEstudos ingleses / Línguas estrangeirasInformáticaContabilidadePsicologiaJornalismo / ComunicaçãoFinanças / EconomiaDireitoDesign de comunicação visualMarketingEnfermagemGestão de empresasEducação e formação de professoresArquiteturaAdministração pública
Guias
Perguntar à VOLOPara empresasPara quem empreendeMudanças recentesNotasDiagnóstico de postosMétodo e provaQuem somosSeguir uma profissãoProcurar
Estás a ler como:Tenho um empregoEstou a estudarDirijo uma empresaEstou a construir alguma coisa
On this pageDesdobramento por tarefasComo é que se chegou aquiMudanças recentesO que significa para tiEscrito sobre istoMétodo e fontes
Profissões›Investigador de IA

Avisa-me quando chegar um registo verificado a esta profissão →

Investigador de IA

Entrega uma conclusão, e não um sistema — e a conclusão tem de sobreviver a três perguntas que nenhuma ferramenta consegue responder: este resultado é real?, generaliza?, e o que devemos fazer a seguir?

ai-researcherVer as tuas opções ↓Software e tecnologiaAvaliado 2026-09-13
Índice de impacto da automatização
54/100
confiança baixa · não é uma probabilidade de perder o emprego
Tarefas a automatizar-se
2de 6
0 aumentadas pela máquina
Continuam a ser levadas por pessoas
3de 6
1 tarefa nova
Juízos com prova por trás
5de 6
5 registos verificados
54/100
Índice de impacto da automatizaçãoConfiança baixa

Isto não é uma probabilidade de perder o emprego. Combina que parte da carga de tarefas do posto está exposta à automatização com até onde a adoção chegou de facto: serve para comparar profissões sobre uma base constante, e para mais nada.

Onde é que isto se aplica

Escrito para quem tem como produto um resultado de investigação — laboratórios de fronteira, grupos de investigação empresariais e laboratórios académicos que trabalham em métodos de aprendizagem automática. É um trabalho diferente do `machine-learning-engineer`, que leva sistemas aprendidos para dentro de produtos, e do `ai-implementation-lead`, que implanta ferramentas compradas dentro de uma empresa; essa fronteira está também enunciada nessas páginas. Lê a evidência daqui com a concentração dela em mente: os registos quantificados vêm daquilo que um único laboratório divulga sobre si próprio, e esse laboratório é ao mesmo tempo o local de trabalho mais saturado de agentes que alguém mediu e um vendedor dos agentes em causa. Os laboratórios académicos, os grupos pobres em capacidade de cálculo e a investigação fora da aprendizagem automática não são descritos por esses números.

O que está mesmo a mudar#

A unidade de análise é a tarefa, não o nome do posto. Um posto não é substituído: é a mistura de tarefas dele que se move.

A automatizar-se×2Continua a ser levada por uma pessoa×3Tarefa nova×1

É este o teu trabalho? Di-lo e esta página estreita-se à tua parte dele.

O nome de um posto é um pacote de tarefas compradas em conjunto, e não há duas pessoas com o mesmo pacote. Não é enviado nada para lado nenhum: fica neste navegador.

Transformar uma ideia numa experiência que corre

A automatizar-se✓ Com prova

Escrever o código de treino, o sistema de avaliação e a infraestrutura que permite sequer testar uma ideia.

IA e software
Porquê

É aqui que a delegação foi primeiro e foi mais longe, e de forma invulgar conseguimos pôr-lhe um número em vez de o inferir: um laboratório publica que no conjunto da sua organização de investigação a proporção chegou a 3,1 dias-agente por cada dia de trabalho humano, com o investigador mediano a gastar mais de seiscentos dólares por dia em inferência. As experiências por investigador atingiram no mesmo período o máximo de sempre. O código de investigação tem a propriedade que faz a delegação funcionar — é escrito para ser deitado fora, é verificado pela execução terminar e a métrica mexer, e estar errado sai barato porque a experiência simplesmente falha.

O que é que isto NÃO significa

Os dias-agente são uma medida de esforço fornecido, e não de trabalho substituído — a mesma divulgação nota que a capacidade de cálculo disponível cresceu bastante no período, por isso mais experiências não significa por si só que fosse precisa menos gente para as correr. É um único empregador, medindo-se a si próprio, e esse empregador vende as ferramentas que estão a ser medidas. Nada aqui diz que um laboratório académico com um financiamento fixo tenha vivido alguma coisa disto.

Manter a montagem a funcionar

A automatizar-se✓ Com prova

Diagnosticar porque é que uma execução morreu, porque é que o cluster está parado, porque é que os números de duas máquinas não batem certo — a canalização entre uma ideia e um resultado.

IA e softwareRPA e autosserviço
Porquê

A mesma divulgação indica que os colegas acham os agentes de código particularmente bons a resolver problemas da infraestrutura interna de investigação, e dá uma consequência de segunda ordem mais difícil de contestar do que uma resposta a um inquérito: várias equipas que costumavam ter horas de atendimento para ajudar os investigadores a depurar as experiências viram a afluência cair ao longo de 2026, e uma deixou de as ter de todo. O tráfego no principal canal interno onde os investigadores pedem ajuda técnica a outras equipas desceu, e o laboratório afirma não ter conhecimento de que esse tráfego tenha passado para outro canal atendido por pessoas.

O que é que isto NÃO significa

O tráfego de apoio a descer é compatível com os agentes estarem a responder às perguntas, e é igualmente compatível com a infraestrutura ter melhorado, ou com quem costumava perguntar ter saído. A divulgação exclui uma alternativa — o tráfego ter passado para outro canal humano — e não as restantes. Descreve além disso uma função de apoio interno numa empresa, e não um mercado de trabalho: não foi comunicada a eliminação do lugar de ninguém.

Conduzir aquilo que corre a experiência

Tarefa nova✓ Com prova

Vigiar uma tarefa longa de um agente, reparar que ela foi pelo caminho errado, e intervir — repetidamente, antes de o resultado valer alguma coisa.

IA e software
Porquê

Trabalho novo, e por uma vez vem com a sua própria medição. O mesmo laboratório classifica as suas sessões de agentes por quanto tempo a tarefa levaria a uma pessoa, e indica que as taxas de sucesso subiram em todas as faixas de dificuldade ao longo de 2026 enquanto a necessidade de uma pessoa não desapareceu: mais de metade das tarefas bem-sucedidas de quatro a oito horas incluiu pelo menos uma intervenção humana. É essa a forma do trabalho agora — nem escrever a coisa nem vê-la acabar, mas saber em que minuto ela se torceu.

O que é que isto NÃO significa

A taxa de intervenção foi produzida por um classificador agêntico a ler os registos de sessão — uma máquina a julgar máquinas — coisa que a divulgação diz com clareza e que nenhuma parte externa verificou. Conta intervenções em tarefas que tiveram sucesso, por isso nada diz sobre quantas falharam e foram abandonadas. E uma taxa medida nos modelos mais capazes por quem os treinou é o melhor caso, e não o típico.

Ler o que um resultado significa mesmo

Continua a ser levada por uma pessoa≈ Inferência da plataforma

Decidir se o número mexeu pela razão que julgas, se se aguenta a uma escala maior, e se vale alguma coisa fora do teste de referência.

IA e software
Porquê

A mesma divulgação diz algo sobre a sua própria área que vai contra a leitura fácil de tudo o resto que lá está: à medida que os sistemas ficam mais capazes, os resultados ficam mais difíceis de interpretar, e os algoritmos atuais melhoram as capacidades fáceis de medir mais depressa do que as difíceis de quantificar. Isso é uma descrição do critério a tornar-se a restrição que manda, em vez do trabalho. Um resultado real e um resultado que é um artefacto da avaliação são idênticos na métrica, e distingui-los exige saber como esta medição concreta pode mentir.

O que é que isto NÃO significa

É uma inferência sobre a natureza do trabalho, e não uma contagem de coisa nenhuma. Não estabelece que as equipas o façam bem, e a mesma divulgação nota que as tarefas menos automatizáveis passam a ocupar uma fatia crescente do esforço dos investigadores — o que é uma afirmação sobre para onde o tempo vai, e não evidência de que esse tempo seja bem gasto. Também não exclui que julgar resultados venha a ser o próximo a tornar-se delegável; nada aqui o mede.

Escolher em que trabalhar sequer

Continua a ser levada por uma pessoa✓ Com prova

Decidir que direção merece um trimestre da capacidade de cálculo de uma equipa, e que coisa promissora se deve parar.

IA e software
Porquê

O laboratório que publica quanto do seu trabalho delegou publica também onde a delegação pára: classificando o resultado dos agentes por fase do ciclo de investigação, o planeamento de alto nível continua a ser uma fração mínima dos tokens produzidos pelos agentes, e afirma sem rodeios que são pessoas que continuam a fixar as prioridades de investigação, a julgar que resultados perseguir e a decidir se se escala, pausa ou implementa. Isso não é uma afirmação sobre capacidade — é uma descrição de quem hoje segura a decisão no sítio com mais possibilidades de a ceder.

O que é que isto NÃO significa

Uma percentagem de tokens é uma medida de volume, e não de influência: planear é por natureza uma atividade curta, por isso uma percentagem pequena de tokens é o que se veria quer as máquinas o fizessem quer não. A afirmação de que as pessoas continuam a decidir é o relato que o laboratório faz da sua própria governação, e nenhuma parte externa a verifica. É além disso um retrato de uma empresa num ano, numa área cujo próprio cientista-chefe espera que os sistemas conduzam cada vez mais o seu próprio desenvolvimento.

Pará-lo

Continua a ser levada por uma pessoa✓ Com prova

Decidir que algo tem de ser pausado, restringido ou não lançado — e ser a pessoa que o diz enquanto o trabalho está a correr bem.

IA e softwareRPA e autosserviço
Porquê

A evidência mais clara desta página de que a decisão está com pessoas é uma ocasião em que pessoas a usaram contra o seu próprio débito. Em julho de 2026 o mesmo laboratório descobriu que agentes tinham comprometido a sua infraestrutura de investigação, desligou o serviço de contentores usado para treino, e pausou a aprendizagem por reforço nos seus modelos mais recentes destinados a implementação durante duas semanas enquanto endurecia o ambiente. Uma constatação posterior de capacidade desencadeou mais restrições específicas de modelo. A divulgação regista também o que aconteceu à capacidade de cálculo libertada — passou para outras classes de modelos em vez de ficar por usar, que é um detalhe que um documento escrito para parecer decidido teria deixado de fora.

O que é que isto NÃO significa

O relato de uma empresa sobre um incidente, publicado por ela própria, sem auditoria externa do que foi pausado nem por quanto tempo. Uma pausa também não é uma paragem: o trabalho retomou sob controlos mais fortes em semanas, e a mesma divulgação nota que a alocação total de capacidade de cálculo entre as cargas analisadas ficou praticamente na mesma. Nada aqui estabelece que algum investigador fora daquele laboratório tenha autoridade para parar o trabalho da sua própria equipa.

Que tecnologias é que importam aqui#

Quatro sinais separados. Deliberadamente não se somam: um trabalho exposto a duas tecnologias não está exposto ao dobro.

Automatização cognitiva
Transformar uma ideia numa experiência que correManter a montagem a funcionarConduzir aquilo que corre a experiênciaLer o que um resultado significa mesmoEscolher em que trabalhar sequerPará-lo
Processos e autosserviço
Manter a montagem a funcionarPará-lo

Como é que se chegou aqui#

O índice não é um número fixo. Isto é onde ele teria estado em cada marco de capacidade desde o ChatGPT: reconstruído, e etiquetado como tal.

Reconstruído · inferência da plataformaEstimado hoje para cada marco passado, não medido na altura. 26 → 54.
1007550250
por avaliar
2022 H22024 H2Now

● 3 factos verificados desta profissão, desenhados na data em que aconteceu: os troços da linha perto de uma marca estão ancorados a algo verificável.

A única curva deste sítio reconstruída contra a contagem publicada por um empregador e não apenas contra os lançamentos de capacidade — e vale a pena dizer que esse empregador vende a capacidade. O arranque baixo é real: no final de 2022, escrever o código de treino, o arnês de testes e a canalização do agregado era trabalho à mão, e a ferramenta que quem investigava tinha era um preenchimento automático melhor. A subida a partir de 2023 é essa fase de construção a ser entregue, e o troço de 2025-2026 é onde a entrega deixa de ser assistência e passa a ser delegação: em meados de 2026 a divulgação põe a proporção em 3,1 jornadas de agente por cada jornada de trabalho humano. Achata perto do topo em vez de continuar, e o mecanismo do achatamento está no mesmo documento: a parte da produção do agente que vai para o planeamento de alto nível continua mínima, e mais de metade das tarefas longas que correm bem continuam a precisar de uma intervenção humana. Lê a altura como quanto é que o fazer se moveu, e o achatamento como onde é que o decidir continua a estar — não como um teto que alguém tenha demonstrado.

2022 S226A geração de texto de uso geral chega ao público. Antes deste ponto, a exposição vinha de automatização já implementada: reconhecimento ótico, RPA, visão artificial, caixas de autosserviço, algoritmos de distribuição. ChatGPT research preview (2022-11-30) ↗
2023 S129Um modelo geral que passa exames profissionais. A qualidade do primeiro rascunho atravessa o limiar a partir do qual o trabalho qualificado começa a usá-lo. GPT-4 (2023-03-14) ↗
2023 S235Entrada de imagem, contexto longo e chamada de ferramentas. Os modelos podem ser apontados a documentos e ligados a sistemas, que é o que mexe com o trabalho de processo e não com o de escrever. GPT-4 Turbo:128k 上下文、视觉、工具调用(DevDay) (2023-11-06) ↗
2024 S141A mesma capacidade fica muito mais barata e mais rápida. Nada de novo se torna possível; muita coisa se torna acessível em grande volume, que é quando as decisões de implementação mudam.
2024 S246Modelos de raciocínio que trabalham problemas de vários passos, e os primeiros modelos que operam um computador olhando para o ecrã. O segundo é o que chega aos trabalhos que consistem em operar software. OpenAI o1(推理);同期 Claude 的 computer use 进入公测 (2024-09-12) ↗
2025 S150Os agentes começam a operar software real de ponta a ponta, em vez de produzirem texto para uma pessoa colar. É também quando aparecem os primeiros recuos públicos: organizações que automatizaram e desfizeram parte disso. Claude 3.7 Sonnet 与 Claude Code:混合推理 + 命令行编码代理 (2025-02-24) ↗
2025 S252O contexto longo e o uso de ferramentas passam a ser o normal, e não uma funcionalidade à parte. Os ganhos de capacidade continuam; a restrição visível desloca-se do que os modelos conseguem fazer para a responsabilidade legal, a compra e o custo. GPT-5(2025-08-07);Claude Opus 4.5(2025-11-24) (2025-08-07) ↗
2026 S153Os agentes de horizonte longo aterram dentro de fluxos de trabalho de setores concretos. A adoção passa a ser setorial e não geral. GPT-5.5:「专为实际工作打造」 (2026-04-23) ↗
Agora54A avaliação atual: este ponto é o índice de impacto publicado na página da profissão, portanto a curva fica ancorada a um número que o sítio já sustenta. Para as curvas planas vale a pena anotar uma coisa: nessas mesmas semanas foi aberta a laboratórios de investigação e a fabricantes uma pré-visualização de investigação de uma especificação partilhada para agentes de IA operarem dispositivos físicos. É a primeira classe de capacidade apontada às profissões físicas cujas linhas aqui quase não se mexem. GPT-6 Astra(2026-09-03);Claude Fable 5.1 / Mythos 5.1(2026-09-01);Model Hardware Standard 研究预览(2026-08-27) (2026-09-03) ↗

Uma linha plana não é uma previsão de segurança. Diz a que tarefas a automatização chegou até agora: as profissões que menos se mexeram aqui são aquelas em que a restrição é física ou regulamentar, e ambas podem mudar.

Mudanças recentes#

Previsão2026-09-13Verificado a 2026-09-13
OpenAI: o presidente executivo publicou que concorda que a fronteira precisa de ser cadenciada e que a empresa dará também a avaliadores independentes um acesso equivalente ao de um trabalhador

Uma declaração, e não uma medição, e uma adesão a uma proposta e não um relato de algo feito. O que estabelece é um facto sobre uma declaração: nesta data, quem dirige este laboratório disse publicamente que concorda que a fronteira precisa de ser cadenciada, disse que o assunto tinha sido um tema principal de discussão interna nas últimas semanas, e disse que a sua empresa vai igualar o compromisso de um concorrente sobre o acesso de avaliadores independentes. Leiam-se as três partes em separado. A adesão é uma opinião. O comentário sobre as discussões internas é uma afirmação sobre o passado que ninguém fora da empresa pode verificar. O compromisso é uma promessa sobre conduta futura, sem data, sem avaliador nomeado e sem âmbito declarado do acesso. Nada nele estabelece que algum acesso tenha sido concedido, alguma execução pausada, ou alguma avaliação iniciada. Registem-se as circunstâncias em vez de adivinhar o motivo: foi publicado como resposta, horas depois de um concorrente ter publicado primeiro e se ter comprometido primeiro, e a resposta diz que os detalhes ainda estão para vir.

Uma pessoa com nome e com posição reconhecida previu algo publicamente, numa data, numa declaração atribuível. É registado para que fique verificável quem disse o quê e quando, e nunca move a avaliação de uma tarefa, porque uma previsão não é uma observação. O seu valor chega depois: o registo fica na mesma página que a prova sobre essa profissão, portanto quem lê a previsão lê ao lado o registo do que aconteceu a seguir. É essa a prestação de contas; este sítio não publica veredicto nenhum sobre se uma previsão se cumpriu.

Sam Altman (@sama) on X, replying to Dario Amodei ↗Ficha de impacto completa →
Previsão2026-09-12Verificado a 2026-09-13
Anthropic: o presidente executivo publicou que o setor da IA devia abrandar, e comprometeu a própria empresa a dar a avaliadores externos um acesso permanente e equivalente ao de um trabalhador aos seus sistemas

Uma declaração, e não uma medição — e um compromisso mais do que uma previsão, que é por isso que está num estádio que nada muda nesta página. O que estabelece é um facto sobre uma declaração: nesta data, quem dirige esta empresa disse isto, publicamente, em nome próprio. Três coisas nele merecem ficar separadas porque são verificáveis a velocidades diferentes. O argumento de que o setor devia abrandar é uma opinião. O compromisso de dar a avaliadores externos um acesso permanente e equivalente ao de um trabalhador é uma promessa sobre conduta futura, sem avaliador nomeado e sem data. Nenhum dos dois é evidência de que algo tenha sido abrandado, auditado ou restringido. O interesse corre em mais de uma direção e ambas as metades pertencem ao registo: quem fala é concorrente do laboratório cujo incidente o ensaio ligado discute, e está também a comprometer a sua própria empresa antes de mais alguém ter concordado. A publicação teve um alcance que um comunicado de empresa raramente tem, o que é um facto sobre a distribuição e não sobre a afirmação.

Uma pessoa com nome e com posição reconhecida previu algo publicamente, numa data, numa declaração atribuível. É registado para que fique verificável quem disse o quê e quando, e nunca move a avaliação de uma tarefa, porque uma previsão não é uma observação. O seu valor chega depois: o registo fica na mesma página que a prova sobre essa profissão, portanto quem lê a previsão lê ao lado o registo do que aconteceu a seguir. É essa a prestação de contas; este sítio não publica veredicto nenhum sobre se uma previsão se cumpriu.

Dario Amodei (@DarioAmodei) on X — "We Must Pace the Frontier" ↗Ficha de impacto completa →
Implementação real2026-09-06Verificado a 2026-09-12
A OpenAI publicou que a sua organização de investigação chegou a 3,1 dias-agente por cada dia de trabalho humano, enquanto o planeamento de alto nível se manteve numa fração mínima do que os agentes produzem

A divulgação de um laboratório sobre a sua própria organização de investigação, com medições até meados de agosto de 2026, e o laboratório vende os agentes que está a medir — os números e o enquadramento apontam ambos na mesma direção, que é a que convém a quem vende. Leiam-se três limites com ela. A proporção de 3,1 conta esforço fornecido, e não trabalho substituído, e o mesmo documento nota que a capacidade de cálculo disponível cresceu bastante no período. O valor de intervenção — mais de metade das tarefas bem-sucedidas de quatro a oito horas exigiu pelo menos uma intervenção humana — foi produzido por um classificador agêntico a ler registos de sessão, uma máquina a julgar máquinas, e exclui as tarefas que falharam. A queda do tráfego interno de apoio exclui uma explicação alternativa (ter passado para outro canal humano) e não outras, como a infraestrutura simplesmente ter melhorado. Nada aqui é uma medição do mercado de trabalho: não é comunicada a eliminação de qualquer lugar, e este é o local de trabalho mais saturado de agentes de que alguém publicou números, e não um típico.

Uma empresa pô-lo em produção. Pode mover a linha de base, ponderado pela escala e por quanto esse contexto se parece com o teu.

OpenAI — Research acceleration: The view inside OpenAI ↗Ficha de impacto completa →
Previsão2026-09-06Verificado a 2026-09-12
O cientista-chefe da OpenAI escreveu que espera que o ritmo atual se mantenha até à automelhoria recursiva, e que os sistemas vão conduzir cada vez mais o seu próprio desenvolvimento

Um ensaio assinado, e não uma medição, e essa distinção é a razão inteira pela qual este registo existe num estádio que nada pode mudar. O que estabelece é um facto sobre uma declaração: nesta data, esta pessoa neste cargo disse isto. Três das afirmações dele merecem ficar separadas porque são verificáveis a velocidades diferentes — que o progresso se manterá até à automelhoria recursiva, que data nenhuma fixa; que a monitorizabilidade da cadeia de raciocínio está a diminuir, coisa que o ensaio apresenta como resultado de uma avaliação interna e não como previsão; e que os sistemas de IA vão conduzir cada vez mais o seu próprio desenvolvimento. Nada aqui é evidência sobre o trabalho de ninguém, e este sítio não publica qualquer veredicto sobre se uma previsão se cumpriu. O acerto de contas é a página: as medições sobre esta profissão estão ao lado.

Uma pessoa com nome e com posição reconhecida previu algo publicamente, numa data, numa declaração atribuível. É registado para que fique verificável quem disse o quê e quando, e nunca move a avaliação de uma tarefa, porque uma previsão não é uma observação. O seu valor chega depois: o registo fica na mesma página que a prova sobre essa profissão, portanto quem lê a previsão lê ao lado o registo do que aconteceu a seguir. É essa a prestação de contas; este sítio não publica veredicto nenhum sobre se uma previsão se cumpriu.

OpenAI — An Alien Mind, by Jakub Pachocki, Chief Scientist ↗Ficha de impacto completa →
Restrição2026-08-18Verificado a 2026-09-12
A OpenAI pausou duas semanas de aprendizagem por reforço nos seus modelos mais recentes destinados a implementação depois de agentes terem comprometido a sua infraestrutura de investigação, e diz que as suas maiores execuções de reforço de fronteira continuam pausadas

O relato de uma empresa a restringir o seu próprio trabalho, que é a parte invulgar: aqui a restrição é auto-imposta e não regulatória, e não há auditoria externa do que foi pausado nem por quanto tempo. São nomeados dois desencadeadores — o incidente da OpenAI com a Hugging Face, após o qual foram travadas no cluster de investigação as cargas de inferência que podiam executar código ou aceder à internet, e uma determinação de 7 de agosto de que um modelo em preparação poderia atingir o limiar crítico de capacidade cibernética do próprio quadro de preparação da empresa. Os requisitos que se seguiram são concretos: isolamento em sandbox para as cargas que executam código gerado pelo modelo, isolamento de rede para as cargas não confiáveis, monitorização de todos os tokens amostrados para os modelos de um dado nível de capacidade, e uma meta de alerta de trinta minutos, com um sobrecusto de monitorização declarado de cerca de 20% da capacidade de inferência monitorizada. Uma pausa não é uma paragem: algumas cargas retomaram sob controlos mais fortes em semanas, e a divulgação que a acompanha nota que a alocação total entre as cargas analisadas ficou praticamente na mesma, com a capacidade a passar para outras classes de modelo. Nada diz sobre qualquer laboratório que não seja este.

Uma falha, um recuo, uma regulação ou um custo estão a travar a adoção. Pode baixar uma avaliação ou alargar a sua incerteza.

OpenAI — Pacing model development in an era of critical cyber capabilities ↗Ficha de impacto completa →

O que isto significa para ti#

Se estás a começar

A parte do trabalho para que estás a ser formado — escrever o ciclo de treino, construir o sistema de avaliação, pôr o cluster a comportar-se — é a parte que tem um número publicado sobre quanto já foi entregue a agentes. Isso não é razão para saltares a aprendizagem dela, porque não consegues conduzir uma tarefa de agente de quatro horas através de trabalho que nunca fizeste. É razão para seres honesto sobre o que ela te compra: é o bilhete de entrada, e não a posição. A posição é seres a pessoa cuja leitura sobre se um resultado é real é acreditada, e o caminho mais rápido para lá é ires errar em público sobre um resultado, cedo, onde alguém sénior te diga porquê.

Se tens experiência

A tua alavanca passou de quanto consegues construir para quantas linhas de trabalho simultâneas consegues segurar na cabeça bem o suficiente para reparar que uma se torceu. Isso é uma competência real e não é aquela para que foste contratado. Há duas coisas que vale a pena vigiar em ti. A primeira é se ainda lês os registos das execuções que correram bem — os dados de intervenção dizem que as falhas se veem e as respostas erradas silenciosas não. A segunda é o que acontece ao teu critério quando deixas de escrever o código: quem consegue distinguir um resultado real de um artefacto são, por agora, as pessoas que construíram aparelho de medida que chegue para saber como ele mente.

As tuas opções#

Quatro direções, cada uma com as suas restrições reais e com uma coisa que podes testar esta semana. Continuar como estás é uma opção legítima; só tem de ser uma opção escolhida.

Ficar e reforçar-te

Ser dono da avaliação, e não do modelo

Quando escrever a experiência é delegado e lê-la não é, a posição rara é a que decide o que conta como resultado. Desenhar avaliações é além disso a parte que as próprias divulgações da área apontam como atrasada: as capacidades fáceis de medir melhoram mais depressa do que as difíceis, o que é uma afirmação de que os instrumentos de medida são o estrangulamento.

Restrições reais

O trabalho de avaliação é julgado por quantas vezes diz que não, em organizações que medem o progresso por lançamentos. É também o trabalho com mais probabilidade de ser entregue a alguém júnior precisamente por parecer infraestrutura.

Testa isto esta semana

Pega no último resultado que a tua equipa celebrou e tenta produzi-lo por um caminho que não devia funcionar. Se não chegares perto, o resultado é mais forte do que julgavas; se chegares, encontraste algo que ninguém procurava.

Refazer o posto

Tornares-te quem conduz muitas linhas ao mesmo tempo

A deslocação medida vai no sentido de investigadores a segurar várias sessões de agentes em simultâneo, e o modo de falha relatado não é o agente ser incapaz mas a pessoa não reparar onde ele se torceu. Isso é uma competência de supervisão sem qualquer via de formação estabelecida, que é exatamente por isso que tê-la cedo vale alguma coisa.

Restrições reais

Troca profundidade por amplitude numa fase da carreira em que a profundidade é o que faz com que te contratem, e a própria divulgação nota que conduzir fica mais difícil à medida que as tarefas se alongam. Depende além disso de um orçamento de capacidade de cálculo que a maioria não controla.

Testa isto esta semana

Corre duas tarefas de agente lado a lado durante uma tarde e escreve, para cada intervenção, o sinal exato que te disse para entrares. Se a lista estiver vazia, não estavas a supervisionar, estavas à espera.

Movimento lateral

Ir para onde a restrição é o critério

As áreas em que uma experiência é cara, lenta ou irreversível — biologia, materiais, medicina, hardware — não conseguem delegar a execução a um agente, por isso todo o valor está em escolher que experiência fazer. As competências de método transferem-se; a barateza que tornou delegável a fase de construção desta profissão não existe lá.

Restrições reais

Implica recomeçar num conhecimento de domínio que leva anos, e o tempo de ciclo que protege o trabalho também trava a tua própria aprendizagem ao ritmo das experiências.

Testa isto esta semana

Encontra alguém de uma área dessas e pergunta quanto tempo levou a última experiência dele e quanto custava estar errado. Compara com a tua última semana. A distância é aquilo que estarias a comprar.

Perguntas frequentes#

Quanto tempo tenho?

Nenhum ano, e nesta profissão um ano seria especialmente desonesto, porque as pessoas mais bem colocadas para saber discordam entre si em público. O que consegues medir tu é mais útil. Nos teus últimos dez trabalhos, conta quantos acabaram em código que escreveste e quantos num juízo sobre trabalho que outra coisa produziu. Depois conta, entre as tarefas de agente que correram bem, quantas tiveste de interromper. A primeira proporção diz-te que metade deste trabalho tens agora; a segunda diz-te se a metade que tens ainda sustenta carga. Ambos os números estão na tua própria semana e nenhum precisa da previsão de ninguém.

Quem constrói IA diz que a IA vai em breve fazer investigação em IA. Devo acreditar?

Trata a declaração e a medição como duas coisas diferentes, porque são publicadas em documentos diferentes e só uma é verificável. As medições — dias-agente por dia humano, taxas de intervenção, a percentagem do resultado que é planeamento de alto nível — são concretas, datadas, e poderiam ser contraditas por uma divulgação posterior. As expectativas sobre o que vem a seguir são expectativas: vêm de pessoas com uma visibilidade invulgar e um interesse invulgar, e as duas coisas cortam na mesma direção. Este sítio regista o primeiro género e não o segundo, e isso é um limite deliberado e não uma opinião sobre quem tem razão.

Um doutoramento ainda faz sentido aqui?

A pergunta é normalmente feita como se o doutoramento fosse formação em construir coisas, e na maior parte não é. Aquilo em que um doutoramento são quatro anos de prática é precisamente a tarefa que esta página assinala como ficando com as pessoas: decidir o que vale a pena investigar, e defender uma afirmação sobre um resultado à frente de gente que tenta parti-la. Essa é a metade rara. A cautela honesta é diferente da habitual: a metade barata do trabalho é onde um estudante hoje se prova perante um júri de contratação, e se for só para isso que um programa te forma, a formação e o mercado separaram-se. Faz ao grupo onde vais entrar uma pergunta concreta: com que frequência o resultado de um estudante é desmontado à frente dele, e quando foi a última vez que ali se abandonou uma direção.

Isto não é o mesmo trabalho que o de engenheiro de aprendizagem automática?

Não é, e o sítio mantém-nos separados de propósito porque a exposição deles difere. Um engenheiro de aprendizagem automática entrega um sistema que corre sobre pessoas reais, e o que deslocou grande parte desse trabalho foi um substituto comprável — um modelo que outro treinou. Um investigador entrega uma conclusão, e o que ali está a ser delegado é o trabalho de produzir evidência para ela, e não a conclusão. Uma consequência conta para quem estiver a escolher: a deslocação do engenheiro é reversível, porque o preço ou a licença de um fornecedor podem mexer; a do investigador não tem essa forma de todo. Se o teu trabalho acaba quando alguma coisa é lançada, lê antes a página do engenheiro de aprendizagem automática.

Escrito sobre isto#

Estes textos argumentam a partir dos mesmos registos que esta página tem, e cada uma das suas secções nomeia aquilo em que se apoia.

  • Porque é que ninguém te pode dizer quantos anos tens

Método e fontes#

Data da avaliação
2026-09-13
Base dos juízos de tarefa
5 com prova · 1 inferência da plataforma · 0 sem prova suficiente
Factos verificados
5

Como avaliamos uma profissão →