Avisa-me quando chegar um registo verificado a esta profissão → · Marcar quais destas tarefas são suas (VOLO Pro, gratuito durante o lançamento) →
Cientista de dados
Transforma uma pergunta de negócio ou de investigação em algo a que os dados consigam responder: enquadra-a, limpa e explora os dados, constrói e valida modelos estatísticos ou preditivos, desenha e lê experiências, e explica a quem decide o que o resultado mostra e o que não mostra. Os agentes de IA já conseguem escrever grande parte do código de análise, mas nos testes de referência públicos os melhores ainda resolvem cerca de um terço das tarefas realistas de análise de dados, e é nas questões causais que têm mais dificuldade. Os supervisores bancários continuam a esperar que os modelos sejam contestados por pessoas independentes, e as projeções dos EUA contam com o crescimento dos empregos em ciência de dados.
Pega numa análise recente que tenhas feito e escreve se mostrou uma causa ou apenas uma associação, e que experiência a teria resolvido.
Isto não é uma probabilidade de perder o emprego. Combina que parte da carga de tarefas do posto está exposta à automatização com até onde a adoção chegou de facto: serve para comparar profissões sobre uma base constante, e para mais nada.
Escrito para cientistas de dados que constroem modelos e conduzem experiências para informar decisões — em empresas de tecnologia, bancos e seguradoras, na investigação e no setor público. Os analistas que trabalham sobretudo em SQL e painéis têm a sua própria página, tal como os engenheiros que constroem e põem a funcionar sistemas de aprendizagem automática em produção. A evidência são testes de referência de agentes de IA em tarefas de ciência de dados, orientações dos supervisores bancários sobre o risco de modelos, regras sobre a auditoria de decisões automatizadas e projeções do mercado de trabalho dos EUA; estabelece o que os agentes conseguem fazer em tarefas de teste e o que as regras esperam das pessoas, não como mudou o tempo dos cientistas de dados.
O que está mesmo a mudar#
A unidade de análise é a tarefa, não o nome do posto. Um posto não é substituído: é a mistura de tarefas dele que se move.
Cada quadrado é uma tarefa. O tamanho é o peso que tem no trabalho; a cor, para onde a tarefa está a ir. Clique num quadrado para ver o que esse juízo não estabelece.
Isto assenta na natureza do trabalho e na lista de tarefas candidatas da O*NET; nenhum registo aqui mede como se faz o enquadramento nem quem o faz.
As tarefas de um teste de referência não são os dados de uma empresa, e os deveres da UE para sistemas de risco elevado só se aplicam mais tarde; nada aqui mede o tempo gasto a limpar dados.
Os testes de referência envelhecem depressa e testam tarefas curtas; não mostram como se constroem modelos em projetos reais nem quanto do trabalho os agentes já fazem.
O teste avaliou modelos de 2024 com questões de manual; modelos mais recentes podem sair-se melhor, e não mede experiências em produtos reais.
Uma projeção não é um resultado, e conta empregos, não as tarefas que esses empregos envolvem.
As orientações bancárias não são vinculativas e abrangem os grandes bancos; a regra de Nova Iorque abrange ferramentas de recrutamento numa cidade. Nenhuma delas mede quantas pessoas fazem este trabalho.
É este o teu trabalho? Di-lo e esta página estreita-se à tua parte dele.
O nome de um posto é um pacote de tarefas compradas em conjunto, e não há duas pessoas com o mesmo pacote. Não é enviado nada para lado nenhum: fica neste navegador.
Mudanças recentes#
Estados Unidos. As perspetivas profissionais do gabinete de estatísticas projetam que o emprego de cientistas de dados cresça 35 por cento de 2025 a 2035, muito acima da média de todas as profissões, com cerca de 24.800 vagas por ano, em média, ao longo da década. É uma projeção para um país, feita enquanto as empresas integram sistemas de IA no seu trabalho; conta empregos, não as tarefas que esses empregos envolvem.
Uma pessoa com nome e com posição reconhecida previu algo publicamente, numa data, numa declaração atribuível. É registado para que fique verificável quem disse o quê e quando, e nunca move a avaliação de uma tarefa, porque uma previsão não é uma observação. O seu valor chega depois: o registo fica na mesma página que a prova sobre essa profissão, portanto quem lê a previsão lê ao lado o registo do que aconteceu a seguir. É essa a prestação de contas; este sítio não publica veredicto nenhum sobre se uma previsão se cumpriu.
Estados Unidos. As orientações revistas das agências bancárias sobre o risco de modelos substituem a SR 11-7 de 2011. Dizem que a contestação efetiva é feita por indivíduos com a competência adequada para conduzir uma contestação crítica e objetiva, independência suficiente para manter a objetividade, e a posição e a influência na organização para provocar mudanças; afirmam que os modelos de IA generativa e de IA agêntica não estão no seu âmbito; e dizem que as orientações não fixam normas vinculativas, pelo que o incumprimento não resultará em crítica da supervisão. São mais relevantes para organizações bancárias com mais de 30 mil milhões de dólares em ativos totais.
Uma falha, um recuo, uma regulação ou um custo estão a travar a adoção. Pode baixar uma avaliação ou alargar a sua incerteza.
Um teste de referência académico de tarefas de programação de ciência de dados que exigem que um agente trabalhe com dados reais e escreva código, incluindo tratamento e análise de dados. Relata que, com o seu agente de base, os melhores modelos de linguagem atuais atingem apenas 30,5% de exatidão, deixando ampla margem para melhorias. Testa modelos de 2024 em tarefas concebidas para o efeito.
Uma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Um teste de referência de 466 tarefas de análise de dados e 74 tarefas de modelação de dados tiradas de competições da Eloquence e do Kaggle, usado para testar agentes de IA construídos sobre modelos como o GPT-4o, o Claude e o Gemini. Relata que o melhor agente resolveu apenas 34,12% das tarefas de análise de dados e ficou com uma diferença de desempenho relativa de 34,74% nas tarefas de modelação. Testa modelos disponíveis em 2024–2025 em tarefas de competição, não trabalho com os dados de uma empresa; a entidade empregadora de um dos autores desenvolve modelos de IA.
Uma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
União Europeia. O artigo 10.º do Regulamento da IA diz que os conjuntos de dados de treino, validação e teste dos sistemas de IA de risco elevado devem estar sujeitos a práticas de governação e gestão de dados, incluindo a preparação dos dados, como a anotação, a rotulagem e a limpeza, e o exame tendo em vista possíveis enviesamentos; o artigo 14.º diz que os sistemas de risco elevado devem ser concebidos de modo a poderem ser efetivamente supervisionados por pessoas singulares. As obrigações vinculam os fornecedores de sistemas de risco elevado; nos termos do regulamento de alteração de 2026, as obrigações de risco elevado para os sistemas enumerados no anexo III aplicam-se a partir de 2 de dezembro de 2027.
Uma falha, um recuo, uma regulação ou um custo estão a travar a adoção. Pode baixar uma avaliação ou alargar a sua incerteza.
Um teste de referência académico de 411 questões com folhas de dados tiradas de manuais, materiais de aprendizagem em linha e artigos académicos, que testa o raciocínio estatístico e causal. Relata que o modelo mais forte, o GPT-4, atinge 58% de exatidão, e que os modelos têm dificuldade com a análise de dados e o raciocínio causal e em usar em simultâneo o conhecimento causal e os dados fornecidos. Testa modelos de 2024 com questões ao estilo de manual, não experiências em produtos reais.
Uma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Cidade de Nova Iorque. A regra final que aplica a lei da cidade sobre ferramentas automatizadas de decisão em matéria de emprego diz que um empregador ou uma agência de emprego não pode usar nem continuar a usar uma dessas ferramentas se tiver passado mais de um ano desde a sua auditoria de enviesamento mais recente; que uma auditoria de enviesamento tem, no mínimo, de calcular a taxa de seleção e o rácio de impacto para cada categoria; e que um auditor não é independente se estiver ou tiver estado envolvido na utilização, no desenvolvimento ou na distribuição da ferramenta. As ferramentas abrangidas incluem aprendizagem automática, modelação estatística e análise de dados. Aplica-se ao recrutamento e à promoção numa cidade.
Uma regulação, um subsídio ou uma compra pública estão a exigir ou a financiar a adoção: o espelho de uma restrição. Mostra que a adoção está a ser exigida, não que tenha acontecido, por isso um mandato nunca chega sozinho; dois independentes chegam.
O que isto significa para ti#
Se estás a começar, as partes do trabalho que um agente de IA faz melhor — escrever código de análise e de modelação de rotina — são aquelas sobre as quais as funções júnior costumavam assentar. Constrói o teu valor onde a evidência diz que os agentes são mais fracos: enquadrar a pergunta, desenhar experiências e raciocinar sobre causas, e explicar resultados a pessoas que têm de decidir.
Conta com rever e dirigir código gerado mais do que escrevê-lo, e conta com que mais do teu tempo vá para validação, documentação e auditorias à medida que as regras sobre decisões automatizadas se espalham. A tua posição para contestar um modelo — e para que acreditem em ti quando dizes onde ele deixa de valer — é a parte em torno da qual as regras estão escritas.
As tuas opções#
Quatro direções, cada uma com as suas restrições reais e com uma coisa que podes testar esta semana. Continuar como estás é uma opção legítima; só tem de ser uma opção escolhida.
Continua cientista de dados e aproxima-te das experiências e do trabalho causal
O raciocínio causal e o desenho de experiências são onde os testes de referência mostram os modelos com mais dificuldade, e as decisões dependem deles.
As funções de experimentação existem sobretudo em grandes empresas de produto e na investigação; empresas mais pequenas podem não fazer testes suficientes para precisarem de uma.
Pega numa análise recente que tenhas feito e escreve se mostrou uma causa ou apenas uma associação, e que experiência a teria resolvido.
Assume a validação e a auditoria de modelos
Os supervisores bancários esperam uma contestação independente dos modelos e a cidade de Nova Iorque exige auditorias de enviesamento independentes às ferramentas de recrutamento; o trabalho precisa de pessoas que percebam de modelos e que não sejam quem os construiu.
Independência significa não auditar os modelos da tua própria equipa, o que pode implicar mudar de equipa ou de empregador; as orientações bancárias não são vinculativas.
Descobre se a tua organização tem uma função de validação de modelos ou de risco de modelos, e o que verifica antes de um modelo entrar em produção.
Aproxima-te do apoio à decisão: analítica de produto ou de políticas públicas
Explicar o que um resultado significa a quem decide é a parte do trabalho menos tocada pela automatização na evidência aqui reunida.
Estas funções valorizam o conhecimento do domínio e a comunicação mais do que a profundidade técnica, e a remuneração pode ser diferente.
Pergunta a uma pessoa que decide, com quem trabalhes, quais dos teus resultados recentes mudaram uma decisão, e porquê.
Perguntas frequentes#
Não, com a evidência atual. Os agentes de IA conseguem escrever grande parte do código de análise, mas nos testes de referência públicos os melhores ainda resolvem cerca de um terço das tarefas realistas de análise de dados, e são mais fracos no raciocínio causal. As regras sobre modelos esperam que pessoas independentes os contestem e auditem, e as projeções dos EUA contam com o crescimento dos empregos de cientista de dados. O que muda é a combinação: menos código escrito à mão, mais enquadramento, verificação e explicação.
Não respondemos a isso com um número de anos. Há um sinal que podes acompanhar em vez disso: se os agentes de IA começam a igualar as pessoas nas questões causais e experimentais dos testes de referência, e se as regras sobre modelos deixam de exigir uma pessoa independente para os contestar. O primeiro não é verdade hoje; o segundo é o contrário da direção atual.
No DSBench, um teste de referência de 466 tarefas de análise de dados e 74 de modelação de dados tiradas de competições reais, o melhor agente resolveu cerca de 34% das tarefas de análise; no DA-Code os melhores modelos chegaram a cerca de 30,5% de exatidão; e no QRData, um teste de referência de questões estatísticas e causais, o modelo mais forte chegou a 58%. Os testes de referência envelhecem depressa, mas mostram onde os agentes são mais fortes e onde têm dificuldade.
As projeções dos EUA contam com que o emprego de cientistas de dados cresça 35 por cento de 2025 a 2035, muito acima da média. O trabalho está a deslocar-se para enquadrar perguntas, desenhar experiências, validar e auditar modelos e explicar resultados — as partes em que os agentes são mais fracos e em que as regras esperam uma pessoa.
Em que assentam estes juízos#
Dos 6 juízos de tarefa desta página, 2 apoiam-se num evento verificado e 4 são inferência da plataforma, cada um etiquetado onde aparece. Por detrás há 2 dimensões tecnológicas, uma trajectória reconstruída desde que os modelos de linguagem chegaram ao público e 7 eventos verificados.
Ver que tecnologias, como chegou aqui e o método →
Onde se situa na classificação oficial: competências, conhecimentos e profissões afins →
Outros cargos na mesma função#
Uma empresa divide o seu trabalho em funções antes de o dividir em cargos. Estes estão em Tecnologia e dados ao lado deste — um facto sobre organigramas, não um juízo de que sejam parecidos ou de que estejam a mudar na mesma direcção.
Programador de software júnior · Engenheiro de software experiente · Programador frontend · Programador backend · Engenheiro de dados · Engenheiro de aprendizagem automática · Investigador de IA · Testador de software / engenheiro de QA · Analista de dados · Analista de negócio · Responsável de sistemas de negócio · Técnico de suporte informático / helpdesk · Analista de segurança (SOC) · Engenheiro de DevOps / plataforma / SRE · Engenheiro de redes · Redator técnico / engenheiro de documentação
