Cientista de dados — tarefas, uma a uma
A unidade de análise é a tarefa, não o nome do cargo. Cada uma das seguintes traz a sua direção, se o juízo assenta em prova ou numa inferência da plataforma, o raciocínio e o que não estabelece.
Todas as tarefas desta página#
Enquadrar a pergunta e a métrica
Continua a ser levada por uma pessoa≈ Inferência da plataformaPerceber o que quem decide precisa realmente de saber, e que grandeza mensurável responderia a isso sem recompensar a coisa errada.
O ponto de partida é uma conversa com pessoas que ainda não sabem o que perguntar, e o risco é uma métrica fácil de mexer e errada de otimizar. A tarefa candidata mais recente da O*NET para esta profissão é entrevistar as partes interessadas para identificar as perguntas a que a análise de dados deve responder — trabalho a ser acrescentado, não retirado.
Isto assenta na natureza do trabalho e na lista de tarefas candidatas da O*NET; nenhum registo aqui mede como se faz o enquadramento nem quem o faz.
Limpar e explorar os dados
Aumentada pela máquina✓ Com provaDescobrir o que está errado nos dados, decidir o que corrigir ou excluir, e ganhar uma noção do que podem e não podem dizer.
Os agentes de IA conseguem escrever o código de tratamento dos dados, mas num teste de referência de tarefas realistas de análise de dados o melhor agente resolveu apenas cerca de um terço delas. Quando o modelo é de risco elevado, o Regulamento da IA da UE torna o próprio trabalho com os dados um dever documentado: os dados de treino, validação e teste têm de estar sujeitos a práticas de governação de dados que abranjam a limpeza e o exame de possíveis enviesamentos.
As tarefas de um teste de referência não são os dados de uma empresa, e os deveres da UE para sistemas de risco elevado só se aplicam mais tarde; nada aqui mede o tempo gasto a limpar dados.
Construir e validar o modelo
Aumentada pela máquina≈ Inferência da plataformaEscolher uma abordagem, ajustá-la e afiná-la, e verificar que se aguenta em dados que não viu.
É aqui que os agentes de IA são mais capazes e ainda ficam bem aquém: nos testes de referência públicos os melhores agentes resolvem cerca de um terço das tarefas de análise de dados e chegam a cerca de 30% de exatidão em tarefas de programação de ciência de dados. O cientista de dados dirige e verifica cada vez mais código gerado, em vez de o escrever todo.
Os testes de referência envelhecem depressa e testam tarefas curtas; não mostram como se constroem modelos em projetos reais nem quanto do trabalho os agentes já fazem.
Desenhar experiências e ler causas
Continua a ser levada por uma pessoa≈ Inferência da plataformaMontar o teste A/B ou o estudo de modo a que a resposta seja fiável, e dizer se uma mudança causou o resultado ou apenas veio com ele.
O raciocínio causal é onde os modelos são mais fracos na evidência aqui reunida: num teste de referência de questões estatísticas e causais tiradas de manuais e artigos, o modelo mais forte chegou a 58% de exatidão, e os autores concluíram que os modelos têm dificuldade em usar ao mesmo tempo o conhecimento causal e os dados fornecidos.
O teste avaliou modelos de 2024 com questões de manual; modelos mais recentes podem sair-se melhor, e não mede experiências em produtos reais.
Explicar o que significa, e o que não significa
Continua a ser levada por uma pessoa≈ Inferência da plataformaApresentar o resultado de modo a que quem decide perceba a incerteza, os pressupostos e o que mudaria a resposta.
Uma decisão assenta na confiança na pessoa que diz o que os números significam e onde deixam de valer. As projeções do mercado de trabalho dos EUA contam com que o emprego de cientistas de dados cresça 35 por cento de 2025 a 2035, muito acima da média, à medida que as organizações trazem sistemas de IA para o seu trabalho.
Uma projeção não é um resultado, e conta empregos, não as tarefas que esses empregos envolvem.
Contestar e auditar modelos
Tarefa nova✓ Com provaTestar de forma independente o modelo de outra pessoa — se funciona, onde falha, se trata grupos de forma injusta — e documentá-lo para um regulador ou um auditor.
As regras em torno dos modelos estão escritas para pessoas: os supervisores bancários dos EUA esperam uma contestação efetiva por indivíduos com a competência, a independência e a posição para alterar um modelo, e deixam por agora a IA generativa e agêntica fora dessas orientações; a cidade de Nova Iorque proíbe usar uma ferramenta automatizada de recrutamento sem uma auditoria de enviesamento no último ano, feita por um auditor independente da ferramenta.
As orientações bancárias não são vinculativas e abrangem os grandes bancos; a regra de Nova Iorque abrange ferramentas de recrutamento numa cidade. Nenhuma delas mede quantas pessoas fazem este trabalho.