Capacidade técnicaAutomatização cognitiva2024-02-27
O modelo mais forte chegou a 58% de exatidão em questões estatísticas e causais tiradas de manuais e artigos, e os modelos tiveram dificuldade em usar em conjunto o conhecimento causal e os dados
Cientista de dadospágina da profissão →Data do facto / publicação
2024-02-27 · publicado 2024-06-09
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Desenhar experiências e ler causas
Montar o teste A/B ou o estudo de modo a que a resposta seja fiável, e dizer se uma mudança causou o resultado ou apenas veio com ele.
Continua a ser levada por uma pessoa≈ Inferência da plataforma
Onde é que isto se aplica
Um teste de referência académico de 411 questões com folhas de dados tiradas de manuais, materiais de aprendizagem em linha e artigos académicos, que testa o raciocínio estatístico e causal. Relata que o modelo mais forte, o GPT-4, atinge 58% de exatidão, e que os modelos têm dificuldade com a análise de dados e o raciocínio causal e em usar em simultâneo o conhecimento causal e os dados fornecidos. Testa modelos de 2024 com questões ao estilo de manual, não experiências em produtos reais.
O que isto significa
Distinguir uma causa de uma coincidência é onde os modelos testados eram mais fracos — e é a pergunta em que assenta a maioria das decisões. Essa parte do trabalho do cientista de dados é, até agora, a menos assistida pelas ferramentas.
O que ainda não mostra
Um teste de referência de 2024 com questões de manual; modelos mais recentes podem sair-se melhor, e não mede experiências reais.
O que podes verificar
Abre o arXiv 2402.17644 (QRData) e procura «The strongest model GPT-4 achieves an accuracy of 58%».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 1 juízo ligado em cima ficam onde estavam.
Fonte
Liu et al. — Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data (QRData), arXiv 2402.17644 (submitted 27 Feb 2024; Findings of ACL 2024) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.