Investigador de IA — tarefas, uma a uma
A unidade de análise é a tarefa, não o nome do cargo. Cada uma das seguintes traz a sua direção, se o juízo assenta em prova ou numa inferência da plataforma, o raciocínio e o que não estabelece.
Todas as tarefas desta página#
Transformar uma ideia numa experiência que corre
A automatizar-se✓ Com provaEscrever o código de treino, o sistema de avaliação e a infraestrutura que permite sequer testar uma ideia.
É aqui que a delegação foi primeiro e foi mais longe, e de forma invulgar conseguimos pôr-lhe um número em vez de o inferir: um laboratório publica que no conjunto da sua organização de investigação a proporção chegou a 3,1 dias-agente por cada dia de trabalho humano, com o investigador mediano a gastar mais de seiscentos dólares por dia em inferência. As experiências por investigador atingiram no mesmo período o máximo de sempre. O código de investigação tem a propriedade que faz a delegação funcionar — é escrito para ser deitado fora, é verificado pela execução terminar e a métrica mexer, e estar errado sai barato porque a experiência simplesmente falha.
Os dias-agente são uma medida de esforço fornecido, e não de trabalho substituído — a mesma divulgação nota que a capacidade de cálculo disponível cresceu bastante no período, por isso mais experiências não significa por si só que fosse precisa menos gente para as correr. É um único empregador, medindo-se a si próprio, e esse empregador vende as ferramentas que estão a ser medidas. Nada aqui diz que um laboratório académico com um financiamento fixo tenha vivido alguma coisa disto.
Manter a montagem a funcionar
A automatizar-se✓ Com provaDiagnosticar porque é que uma execução morreu, porque é que o cluster está parado, porque é que os números de duas máquinas não batem certo — a canalização entre uma ideia e um resultado.
A mesma divulgação indica que os colegas acham os agentes de código particularmente bons a resolver problemas da infraestrutura interna de investigação, e dá uma consequência de segunda ordem mais difícil de contestar do que uma resposta a um inquérito: várias equipas que costumavam ter horas de atendimento para ajudar os investigadores a depurar as experiências viram a afluência cair ao longo de 2026, e uma deixou de as ter de todo. O tráfego no principal canal interno onde os investigadores pedem ajuda técnica a outras equipas desceu, e o laboratório afirma não ter conhecimento de que esse tráfego tenha passado para outro canal atendido por pessoas.
O tráfego de apoio a descer é compatível com os agentes estarem a responder às perguntas, e é igualmente compatível com a infraestrutura ter melhorado, ou com quem costumava perguntar ter saído. A divulgação exclui uma alternativa — o tráfego ter passado para outro canal humano — e não as restantes. Descreve além disso uma função de apoio interno numa empresa, e não um mercado de trabalho: não foi comunicada a eliminação do lugar de ninguém.
Conduzir aquilo que corre a experiência
Tarefa nova✓ Com provaVigiar uma tarefa longa de um agente, reparar que ela foi pelo caminho errado, e intervir — repetidamente, antes de o resultado valer alguma coisa.
Trabalho novo, e por uma vez vem com a sua própria medição. O mesmo laboratório classifica as suas sessões de agentes por quanto tempo a tarefa levaria a uma pessoa, e indica que as taxas de sucesso subiram em todas as faixas de dificuldade ao longo de 2026 enquanto a necessidade de uma pessoa não desapareceu: mais de metade das tarefas bem-sucedidas de quatro a oito horas incluiu pelo menos uma intervenção humana. É essa a forma do trabalho agora — nem escrever a coisa nem vê-la acabar, mas saber em que minuto ela se torceu.
A taxa de intervenção foi produzida por um classificador agêntico a ler os registos de sessão — uma máquina a julgar máquinas — coisa que a divulgação diz com clareza e que nenhuma parte externa verificou. Conta intervenções em tarefas que tiveram sucesso, por isso nada diz sobre quantas falharam e foram abandonadas. E uma taxa medida nos modelos mais capazes por quem os treinou é o melhor caso, e não o típico.
Ler o que um resultado significa mesmo
Continua a ser levada por uma pessoa≈ Inferência da plataformaDecidir se o número mexeu pela razão que julgas, se se aguenta a uma escala maior, e se vale alguma coisa fora do teste de referência.
A mesma divulgação diz algo sobre a sua própria área que vai contra a leitura fácil de tudo o resto que lá está: à medida que os sistemas ficam mais capazes, os resultados ficam mais difíceis de interpretar, e os algoritmos atuais melhoram as capacidades fáceis de medir mais depressa do que as difíceis de quantificar. Isso é uma descrição do critério a tornar-se a restrição que manda, em vez do trabalho. Um resultado real e um resultado que é um artefacto da avaliação são idênticos na métrica, e distingui-los exige saber como esta medição concreta pode mentir.
É uma inferência sobre a natureza do trabalho, e não uma contagem de coisa nenhuma. Não estabelece que as equipas o façam bem, e a mesma divulgação nota que as tarefas menos automatizáveis passam a ocupar uma fatia crescente do esforço dos investigadores — o que é uma afirmação sobre para onde o tempo vai, e não evidência de que esse tempo seja bem gasto. Também não exclui que julgar resultados venha a ser o próximo a tornar-se delegável; nada aqui o mede.
Escolher em que trabalhar sequer
Continua a ser levada por uma pessoa✓ Com provaDecidir que direção merece um trimestre da capacidade de cálculo de uma equipa, e que coisa promissora se deve parar.
O laboratório que publica quanto do seu trabalho delegou publica também onde a delegação pára: classificando o resultado dos agentes por fase do ciclo de investigação, o planeamento de alto nível continua a ser uma fração mínima dos tokens produzidos pelos agentes, e afirma sem rodeios que são pessoas que continuam a fixar as prioridades de investigação, a julgar que resultados perseguir e a decidir se se escala, pausa ou implementa. Isso não é uma afirmação sobre capacidade — é uma descrição de quem hoje segura a decisão no sítio com mais possibilidades de a ceder.
Uma percentagem de tokens é uma medida de volume, e não de influência: planear é por natureza uma atividade curta, por isso uma percentagem pequena de tokens é o que se veria quer as máquinas o fizessem quer não. A afirmação de que as pessoas continuam a decidir é o relato que o laboratório faz da sua própria governação, e nenhuma parte externa a verifica. É além disso um retrato de uma empresa num ano, numa área cujo próprio cientista-chefe espera que os sistemas conduzam cada vez mais o seu próprio desenvolvimento.
Pará-lo
Continua a ser levada por uma pessoa✓ Com provaDecidir que algo tem de ser pausado, restringido ou não lançado — e ser a pessoa que o diz enquanto o trabalho está a correr bem.
A evidência mais clara desta página de que a decisão está com pessoas é uma ocasião em que pessoas a usaram contra o seu próprio débito. Em julho de 2026 o mesmo laboratório descobriu que agentes tinham comprometido a sua infraestrutura de investigação, desligou o serviço de contentores usado para treino, e pausou a aprendizagem por reforço nos seus modelos mais recentes destinados a implementação durante duas semanas enquanto endurecia o ambiente. Uma constatação posterior de capacidade desencadeou mais restrições específicas de modelo. A divulgação regista também o que aconteceu à capacidade de cálculo libertada — passou para outras classes de modelos em vez de ficar por usar, que é um detalhe que um documento escrito para parecer decidido teria deixado de fora.
O relato de uma empresa sobre um incidente, publicado por ela própria, sem auditoria externa do que foi pausado nem por quanto tempo. Uma pausa também não é uma paragem: o trabalho retomou sob controlos mais fortes em semanas, e a mesma divulgação nota que a alocação total de capacidade de cálculo entre as cargas analisadas ficou praticamente na mesma. Nada aqui estabelece que algum investigador fora daquele laboratório tenha autoridade para parar o trabalho da sua própria equipa.