データサイエンティスト · 業務ごと
分析の単位は職種名ではなく業務である。以下の一つひとつが、その方向、判断が証拠に基づくのかプラットフォームの推論なのか、その理由、そして何を立証していないかを伴っている。
このページのすべての業務#
問いと指標を定める
いまも人が主導≈ 本サイトの推定意思決定者が本当に知る必要のあることは何か、そして誤ったものに報いることなくそれに答えられる測定可能な量は何かを見きわめる。
入力は、まだ何を尋ねるべきかを知らない人たちとの会話であり、リスクは、動かしやすく、それを最適化すると誤りになる指標である。O*NET がこの職業に挙げた最も新しい候補タスクは、データ分析が扱うべき問いを特定するために関係者に聞き取りを行うことであり——取り除かれる仕事ではなく、加わる仕事である。
これは仕事の性質と O*NET の候補タスクの一覧に拠っている。問いの立て方や、誰がそれを担うかを測った記録はここにはない。
データを整え、探索する
増強されつつある✓ 証拠に基づくデータの何がおかしいかを見つけ、何を直し何を除くかを決め、そのデータが何を言えて何を言えないかの感触をつかむ。
AIエージェントはデータを整形するコードを書けるが、現実的なデータ分析タスクのベンチマークでは、最良のエージェントでも約三分の一しか解けなかった。モデルが高リスクである場合、EU のAI法はデータの作業そのものを文書化された義務にする——訓練・検証・テストのデータは、クリーニングと起こりうる偏りの検討を含むデータガバナンスの実務に従わなければならない。
ベンチマークのタスクは企業のデータではなく、高リスクの仕組みに対する EU の義務の適用はこれからである。クリーニングに費やす時間を測ったものはここにはない。
モデルを構築し、検証する
増強されつつある≈ 本サイトの推定手法を選び、当てはめて調整し、まだ見ていないデータでも持ちこたえるかを確かめる。
ここはAIエージェントが最も力を発揮しながら、なお大きく届かない場所である。公開ベンチマークでは、最良のエージェントでもデータ分析タスクのおよそ三分の一しか解けず、データサイエンスのコーディングタスクでの正答率は約30%にとどまる。データサイエンティストは、すべてを自分で書くよりも、生成されたコードを指示し確かめる側に回りつつある。
ベンチマークはすぐに古くなり、短いタスクしか試さない。実際の案件でモデルがどう作られているか、エージェントがいま仕事のどれだけを担っているかは示さない。
実験を設計し、因果を読む
いまも人が主導≈ 本サイトの推定答えを信頼できるように A/B テストや調査を組み立て、ある変化が結果を引き起こしたのか、それとも単に一緒に起きただけなのかを言う。
ここにある証拠のなかで、モデルが最も弱いのが因果の推論である。教科書と論文から取った統計と因果の問いのベンチマークで、最も強いモデルの正答率は58%であり、著者たちは、モデルが因果の知識と与えられたデータを同時に使うことに苦戦すると結論づけた。
このベンチマークは2024年時点のモデルを教科書の問いで試したものである。新しいモデルはもっとよくできるかもしれず、実際の製品での実験は測っていない。
それが何を意味し、何を意味しないかを説明する
いまも人が主導≈ 本サイトの推定判断する人が、不確かさ、前提、そして答えを変えうるものを理解できるように結果を示す。
判断は、数字が何を意味しどこで止まるかを語る人への信頼の上に成り立つ。米国の労働予測は、組織がAIの仕組みを仕事に取り入れるなかで、データサイエンティストの雇用が2025年から2035年に35%増え、平均をはるかに上回ると見ている。
予測は結果ではなく、数えているのは職であって、その職がどのタスクを含むかではない。
モデルにチャレンジし、監査する
新しい業務✓ 証拠に基づく他人のモデルを独立に試す——機能するか、どこで失敗するか、集団を不公平に扱っていないか——そして規制当局や監査人のためにそれを文書にする。
モデルをめぐる規則は人を前提に書かれている。米国の銀行監督当局は、モデルを変えさせるだけの専門性・独立性・立場を備えた個人による有効なチャレンジを期待し、生成AIとエージェント型AIは当面そのガイダンスの外に置いている。ニューヨーク市は、過去一年以内に、そのツールから独立した監査人によるバイアス監査を受けていない自動採用ツールの使用を禁じている。
銀行のガイダンスには強制力がなく、対象は大手銀行である。ニューヨークの規則は一つの市の採用ツールを対象とする。どちらも、この仕事をしている人の数は測っていない。