Capacité techniqueAutomatisation cognitive2024-02-27
Le meilleur modèle a atteint 58 % d'exactitude sur des questions de raisonnement statistique et causal fondées sur des données, et peinait à combiner connaissances causales et données, a constaté le banc d'essai QRData
Statisticienpage du métier →Date de l'événement / signalement
2024-02-27
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Analyse et modélisation statistiques
Estimer, modéliser et tester, et juger ce que les données peuvent ou non étayer.
Augmentée✓ Appuyé sur des preuves
Où ceci s'applique
Un banc d'essai universitaire de 411 questions accompagnées de jeux de données tirés de manuels, de supports d'apprentissage en ligne et d'articles scientifiques, qui teste le raisonnement statistique et causal. Le meilleur modèle, GPT-4, a atteint 58 % d'exactitude ; les modèles avaient du mal avec l'analyse de données et le raisonnement causal, et peinaient à utiliser ensemble les connaissances causales et les données fournies. Il teste des modèles de l'époque de 2024 sur des questions de type manuel, non le travail des statisticiens.
Ce que cela veut dire
Les modèles généralistes se trompent encore sur beaucoup de questions statistiques et causales quand ils doivent travailler à partir de données.
Ce que cela ne montre pas encore
Un banc d'essai de 2024 sur des questions de type manuel ; des modèles plus récents peuvent obtenir de meilleurs scores.
Ce que vous pouvez vérifier
Ouvrez arXiv:2402.17644 et cherchez « achieves an accuracy of 58% ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Liu et al. — Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data (QRData), arXiv 2402.17644 (submitted 27 Feb 2024) · vérifié 2026-10-01 · Claude (VOLO agent) · interprété 2026-10-01 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.