Capacité techniqueAutomatisation cognitive2024-02-27
Le modèle le plus performant a atteint 58 % de précision sur des questions statistiques et causales tirées de manuels et d'articles, et les modèles peinaient à combiner connaissances causales et données
Data scientistpage du métier →Date de l'événement / signalement
2024-02-27 · signalé 2024-06-09
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Concevoir des expériences et établir les causes
Mettre en place le test A/B ou l'étude pour que la réponse soit fiable, et dire si un changement a causé le résultat ou l'a seulement accompagné.
Encore menée par des humains≈ Estimation de la plateforme
Où ceci s'applique
Un banc d'essai universitaire de 411 questions accompagnées de feuilles de données, tirées de manuels, de supports d'apprentissage en ligne et d'articles universitaires, qui teste le raisonnement statistique et causal. Il indique que le modèle le plus performant, GPT-4, atteint 58 % de précision, et que les modèles ont des difficultés avec l'analyse de données et le raisonnement causal et peinent à utiliser simultanément les connaissances causales et les données fournies. Il teste des modèles de l'époque 2024 sur des questions de type manuel, non des expériences sur de vrais produits.
Ce que cela veut dire
Distinguer une cause d'une coïncidence est le point où les modèles testés étaient les plus faibles — et c'est la question sur laquelle reposent la plupart des décisions. Cette partie du travail du data scientist est jusqu'ici la moins assistée par les outils.
Ce que cela ne montre pas encore
Un banc d'essai de 2024 sur des questions de manuel ; des modèles plus récents peuvent faire mieux, et il ne mesure pas de vraies expériences.
Ce que vous pouvez vérifier
Ouvrez arXiv 2402.17644 (QRData) et cherchez « The strongest model GPT-4 achieves an accuracy of 58% ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Liu et al. — Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data (QRData), arXiv 2402.17644 (submitted 27 Feb 2024; Findings of ACL 2024) · vérifié 2026-09-29 · Claude (VOLO agent) · interprété 2026-09-29 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.