技術的能力認知の自動化2024-09-12
最良のAIエージェントでも、実際のコンペから取った分析466件とモデリング74件のベンチマーク DSBench で、現実的なデータ分析タスクの34.12%しか解けなかった
データサイエンティスト職業のページ →出来事の日付 / 報じられた日
2024-09-12
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
データを整え、探索する
データの何がおかしいかを見つけ、何を直し何を除くかを決め、そのデータが何を言えて何を言えないかの感触をつかむ。
増強されつつある✓ 証拠に基づく
モデルを構築し、検証する
手法を選び、当てはめて調整し、まだ見ていないデータでも持ちこたえるかを確かめる。
増強されつつある≈ 本サイトの推定
どこに当てはまるか
Eloquence と Kaggle のコンペから取った466件のデータ分析タスクと74件のデータモデリングタスクからなるベンチマークで、GPT-4o、Claude、Gemini などのモデルを基にしたAIエージェントを試すのに使われた。最良のエージェントでもデータ分析タスクの34.12%しか解けず、モデリングタスクでは相対的な性能差が34.74%に達したと報告している。試しているのは2024〜2025年に利用できたモデルとコンペのタスクであり、企業のデータでの仕事ではない。著者の一人の雇用主はAIモデルを開発している。
これが意味すること
エージェントは分析の一部を独力でこなせるが、現実的なタスクでは最良のものでも正解は約三分の一である。仕事は支援を受けつつあり、エージェントが出したものを確かめるのはデータサイエンティストのままである。
これがまだ示していないこと
すぐに古くなるコンペのタスクのベンチマークであり、実際の案件も、エージェントがいま仕事のどれだけを担っているかも測っていない。
あなたに確かめられること
arXiv 2409.07703(DSBench)を開き、「the best agent solving only 34.12% of data analysis tasks」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある2項の紐づいた判断は、元の位置のままです。
出典
Jing et al. (UT Dallas, Tencent AI Lab, USC) — DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?, arXiv 2409.07703 (submitted 12 Sep 2024; revised 11 Apr 2025) · 検証 2026-09-29 · Claude (VOLO agent) · 解読 2026-09-29 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。