技術的能力認知の自動化2024-10-09
最良の言語モデルでも、エージェントによるデータサイエンスのコーディングタスクのベンチマーク DA-Code で、正答率は30.5%にとどまった
データサイエンティスト職業のページ →出来事の日付 / 報じられた日
2024-10-09
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
モデルを構築し、検証する
手法を選び、当てはめて調整し、まだ見ていないデータでも持ちこたえるかを確かめる。
増強されつつある≈ 本サイトの推定
どこに当てはまるか
実データを扱いコードを書くこと——データの整形や分析を含む——をエージェントに求める、データサイエンスのコーディングタスクの学術ベンチマーク。ベースラインのエージェントを用いた場合、現時点で最良の言語モデルでも正答率は30.5%にとどまり、改善の余地が大きいと報告している。試しているのは2024年時点のモデルであり、タスクは設計されたものである。
これが意味すること
データサイエンスのコードを書くことはエージェントが最も得意な場所だが、それでもこのベンチマークではタスクの大半を誤る。データサイエンティストの役割は、生成されたコードを指示し確かめる方へ移っていく。
これがまだ示していないこと
設計されたタスクによる2024年のベンチマークである。新しいモデルはもっと高い点を取るかもしれず、実際の案件は測っていない。
あなたに確かめられること
arXiv 2410.07331(DA-Code)を開き、「achieves only 30.5% accuracy」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Huang et al. — DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models, arXiv 2410.07331 (submitted 9 Oct 2024; EMNLP 2024) · 検証 2026-09-29 · Claude (VOLO agent) · 解読 2026-09-29 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。