Capacidade técnicaAutomatização cognitiva2024-09-12
O melhor agente de IA resolveu apenas 34,12% das tarefas realistas de análise de dados no DSBench, um teste de referência de 466 tarefas de análise e 74 de modelação tiradas de competições reais
Cientista de dadospágina da profissão →Data do facto / publicação
2024-09-12
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Limpar e explorar os dados
Descobrir o que está errado nos dados, decidir o que corrigir ou excluir, e ganhar uma noção do que podem e não podem dizer.
Aumentada pela máquina✓ Com prova
Construir e validar o modelo
Escolher uma abordagem, ajustá-la e afiná-la, e verificar que se aguenta em dados que não viu.
Aumentada pela máquina≈ Inferência da plataforma
Onde é que isto se aplica
Um teste de referência de 466 tarefas de análise de dados e 74 tarefas de modelação de dados tiradas de competições da Eloquence e do Kaggle, usado para testar agentes de IA construídos sobre modelos como o GPT-4o, o Claude e o Gemini. Relata que o melhor agente resolveu apenas 34,12% das tarefas de análise de dados e ficou com uma diferença de desempenho relativa de 34,74% nas tarefas de modelação. Testa modelos disponíveis em 2024–2025 em tarefas de competição, não trabalho com os dados de uma empresa; a entidade empregadora de um dos autores desenvolve modelos de IA.
O que isto significa
Os agentes conseguem fazer sozinhos parte da análise, mas em tarefas realistas os melhores ainda só acertam cerca de um terço. O trabalho está a ser assistido, e a verificação do que o agente produziu continua com o cientista de dados.
O que ainda não mostra
Um teste de referência de tarefas de competição que envelhece depressa; não mede projetos reais nem quanto do trabalho os agentes já fazem.
O que podes verificar
Abre o arXiv 2409.07703 (DSBench) e procura «the best agent solving only 34.12% of data analysis tasks».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 2 juízos ligados em cima ficam onde estavam.
Fonte
Jing et al. (UT Dallas, Tencent AI Lab, USC) — DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?, arXiv 2409.07703 (submitted 12 Sep 2024; revised 11 Apr 2025) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.