技術的能力認知の自動化2024-02-27
教科書と論文から取った統計と因果の問いで、最も強いモデルの正答率は58%であり、モデルは因果の知識とデータを併せて使うことに苦戦した
データサイエンティスト職業のページ →出来事の日付 / 報じられた日
2024-02-27 · 報じられた日 2024-06-09
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
実験を設計し、因果を読む
答えを信頼できるように A/B テストや調査を組み立て、ある変化が結果を引き起こしたのか、それとも単に一緒に起きただけなのかを言う。
いまも人が主導≈ 本サイトの推定
どこに当てはまるか
教科書、オンライン学習教材、学術論文から取った、データシート付きの411問からなる学術ベンチマークで、統計的推論と因果推論を試す。最も強いモデル GPT-4 の正答率は58%であり、モデルはデータ分析と因果推論に困難を抱え、因果の知識と与えられたデータを同時に使うことに苦戦すると報告している。試しているのは2024年時点のモデルと教科書風の問いであり、実際の製品での実験ではない。
これが意味すること
原因と偶然の一致を見分けることは、試されたモデルが最も弱かった点であり——しかもそれは、たいていの判断が拠って立つ問いである。データサイエンティストの仕事のうちその部分は、いまのところ道具の支援が最も少ない。
これがまだ示していないこと
教科書の問いによる2024年のベンチマークである。新しいモデルはもっとよくできるかもしれず、実際の実験は測っていない。
あなたに確かめられること
arXiv 2402.17644(QRData)を開き、「The strongest model GPT-4 achieves an accuracy of 58%」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Liu et al. — Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data (QRData), arXiv 2402.17644 (submitted 27 Feb 2024; Findings of ACL 2024) · 検証 2026-09-29 · Claude (VOLO agent) · 解読 2026-09-29 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。