この職業に検証済みの記録が入ったら知らせる → · このうちどの業務が自分のものか印を付ける(VOLO Pro、ローンチ期間中は無料) →
データサイエンティスト
ビジネスや研究の問いを、データで答えられる形に変える——問いを立て、データを整えて探索し、統計モデルや予測モデルを構築・検証し、実験を設計して読み解き、その結果が何を示し何を示さないかを意思決定者に説明する。AIエージェントはいまや分析コードの多くを書けるが、公開ベンチマークでは最良のものでも現実的なデータ分析タスクの約三分の一しか解けず、因果の問いで最も苦戦する。銀行監督当局はなお、モデルが独立した人によってチャレンジされることを期待しており、米国の予測はデータサイエンスの職が増えると見ている。
最近の自分の分析を一つ取り上げ、それが因果を示したのか相関だけを示したのか、そしてどんな実験なら決着がついたのかを書き出すこと。
これは職を失う確率ではない。その職の業務量のうちどれだけが自動化にさらされているかと、導入が実際にどこまで進んだかを一つの値に合わせたものであり——同じ一つのものさしで職業どうしを比べるためだけに使える。それ以外には使えない。
技術企業、銀行や保険会社、研究機関、公共部門で、意思決定のためにモデルを構築し実験を行うデータサイエンティストに向けて書いている。主に SQL とダッシュボードで働くアナリストには別のページがあり、学習するシステムを本番で構築・運用するエンジニアにも別のページがある。証拠は、データサイエンスのタスクにおけるAIエージェントのベンチマーク、銀行監督当局のモデル・リスクに関するガイダンス、自動化された判断の監査に関する規則、そして米国の労働予測である。それが確かめるのは、エージェントが試験用のタスクで何ができるか、規則が人に何を求めているかであって、データサイエンティストの時間の使い方がどう変わったかではない。
実際に何が変わりつつあるか#
分析の単位は肩書ではなく業務です。職が置き換えられるのではなく、その業務の構成が移ります。
一つのマスが一つの業務です。大きさはその仕事の中でその業務が占める比重、色はその業務が向かっている方向。マスをクリックすると、その判断がまだ示していないことが見られます。
これは仕事の性質と O*NET の候補タスクの一覧に拠っている。問いの立て方や、誰がそれを担うかを測った記録はここにはない。
ベンチマークのタスクは企業のデータではなく、高リスクの仕組みに対する EU の義務の適用はこれからである。クリーニングに費やす時間を測ったものはここにはない。
ベンチマークはすぐに古くなり、短いタスクしか試さない。実際の案件でモデルがどう作られているか、エージェントがいま仕事のどれだけを担っているかは示さない。
このベンチマークは2024年時点のモデルを教科書の問いで試したものである。新しいモデルはもっとよくできるかもしれず、実際の製品での実験は測っていない。
予測は結果ではなく、数えているのは職であって、その職がどのタスクを含むかではない。
銀行のガイダンスには強制力がなく、対象は大手銀行である。ニューヨークの規則は一つの市の採用ツールを対象とする。どちらも、この仕事をしている人の数は測っていない。
これはあなたの仕事ですか。そう言えば、このページはあなたの持ち分に絞られます。
肩書とは、まとめ買いされた業務の束であり、同じ束を持つ人は二人といません。どこにも送られません——このブラウザの中に留まります。
最近の変化#
米国。統計局の職業見通しは、データサイエンティストの雇用が2025年から2035年に35%増え、全職業の平均を大きく上回り、この十年のあいだ平均して年に約24,800件の求人があると予測している。これは企業がAIの仕組みを仕事に組み込んでいる最中に出された一国の予測であり、数えているのは職であって、その職がどのタスクを含むかではない。
立場のある名指しの人物が、ある日付に、帰属のつく言明として何かを公けに予測した。誰がいつ何を言ったのかが確かめられるまま残るように記録するのであり、そして業務の判断を決して動かさない。予測は観測ではないからである。その価値は後から来る——この記録は、その職業についての証拠と同じページの上に載るので、予測を読む人は、そのあと何が起きたかの記録を隣で読むことになる。それが決算である。この site は、ある予測が当たったかどうかについて何の判定も公表しない。
米国。銀行監督当局の改訂されたモデル・リスク管理のガイダンスは、2011年の SR 11-7 に代わるものである。それによれば、有効なチャレンジは、批判的かつ客観的なチャレンジを行うのに適切な専門性、客観性を保つのに十分な独立性、そして変化をもたらす組織上の立場と影響力を備えた個人によって行われる。生成AIとエージェント型AIのモデルは対象に含まれないと明記し、またこのガイダンスは強制力のある基準を定めるものではなく、従わなくても監督上の指摘にはつながらないとしている。最も関係が深いのは、総資産300億ドル超の銀行組織である。
失敗、撤回、規制、あるいは費用が導入を抑えている。判断を下げる、あるいはその不確かさを広げることがある。
実データを扱いコードを書くこと——データの整形や分析を含む——をエージェントに求める、データサイエンスのコーディングタスクの学術ベンチマーク。ベースラインのエージェントを用いた場合、現時点で最良の言語モデルでも正答率は30.5%にとどまり、改善の余地が大きいと報告している。試しているのは2024年時点のモデルであり、タスクは設計されたものである。
実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
Eloquence と Kaggle のコンペから取った466件のデータ分析タスクと74件のデータモデリングタスクからなるベンチマークで、GPT-4o、Claude、Gemini などのモデルを基にしたAIエージェントを試すのに使われた。最良のエージェントでもデータ分析タスクの34.12%しか解けず、モデリングタスクでは相対的な性能差が34.74%に達したと報告している。試しているのは2024〜2025年に利用できたモデルとコンペのタスクであり、企業のデータでの仕事ではない。著者の一人の雇用主はAIモデルを開発している。
実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
欧州連合。AI法第10条は、高リスクAIシステムの訓練・検証・テストのデータセットは、注釈付け、ラベル付け、クリーニングなどのデータ準備、および起こりうる偏りを念頭に置いた検討を含む、データガバナンスと管理の実務に従うものとすると定める。第14条は、高リスクの仕組みは自然人が実効的に監督できるように設計されるものとすると定める。義務を負うのは高リスクの仕組みの提供者である。2026年の改正規則により、附属書IIIに挙げられた仕組みに対する高リスクの義務は2027年12月2日から適用される。
失敗、撤回、規制、あるいは費用が導入を抑えている。判断を下げる、あるいはその不確かさを広げることがある。
教科書、オンライン学習教材、学術論文から取った、データシート付きの411問からなる学術ベンチマークで、統計的推論と因果推論を試す。最も強いモデル GPT-4 の正答率は58%であり、モデルはデータ分析と因果推論に困難を抱え、因果の知識と与えられたデータを同時に使うことに苦戦すると報告している。試しているのは2024年時点のモデルと教科書風の問いであり、実際の製品での実験ではない。
実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
ニューヨーク市。自動化された雇用判断ツールに関する市の法律を施行する最終規則は、雇用主または職業紹介機関は、直近のバイアス監査から一年以上が経過している場合、そのようなツールを使用し、または使用し続けてはならないとする。また、バイアス監査は最低限、各区分について選考率と影響比を算出しなければならないとし、ツールの使用・開発・流通に関与している、または関与していた監査人は独立していないとする。対象となるツールには、機械学習、統計モデリング、データ分析が含まれる。適用されるのは一つの市の採用と昇進である。
規制、補助金、あるいは公共調達が、導入を求めているか資金を付けている——constraint の鏡である。導入が求められていることを示すのであって、起きたことを示すのではないので、一件の mandate は単独では決して足りず、独立した二件で足りる。
これがあなたにとって何を意味するか#
これから始めるなら、AIエージェントが最も得意とする部分——定型的な分析やモデリングのコードを書くこと——は、かつて若手の職がその上に築かれていた部分である。証拠がエージェントは最も弱いと言っている場所で価値を築くこと——問いを立てること、実験を設計し因果について推論すること、そして判断しなければならない人に結果を説明すること。
コードを書くより、生成されたコードを見直し指示することが増えると考えておくこと。そして自動化された判断に関する規則が広がるにつれて、検証、文書化、監査に使う時間が増えると考えておくこと。モデルに異を唱えられる立場——そしてモデルがどこで止まるかを言ったときに信じてもらえる立場——こそ、規則がその周りに書かれている部分である。
選べる道#
四つの方向。それぞれに現実の制約と、今週試せることが一つ付いています。いまのまま続けることも正当な選択です——ただし、選ばれたものでなければなりません。
データサイエンティストのまま、実験と因果の仕事へ寄っていく
因果推論と実験の設計は、ベンチマークでモデルが最も苦戦している場所であり、判断はそれに依存している。
実験を専門とする職は主に大手のプロダクト企業と研究機関にあり、小さな会社では、そうした職が要るほどのテストを回していないことがある。
最近の自分の分析を一つ取り上げ、それが因果を示したのか相関だけを示したのか、そしてどんな実験なら決着がついたのかを書き出すこと。
モデルの検証と監査を引き受ける
銀行監督当局はモデルへの独立したチャレンジを期待し、ニューヨーク市は採用ツールの独立したバイアス監査を求めている。この仕事には、モデルを理解していて、しかもそれを作った当人ではない人が要る。
独立性とは自分のチームのモデルを監査しないことであり、チームや雇用主を移ることを意味しうる。銀行のガイダンスには拘束力がない。
自分の組織にモデル検証やモデル・リスクの機能があるか、そしてモデルが本番に出る前にそこが何を確かめているかを調べること。
意思決定の支援へ移る——プロダクトや政策の分析
結果が何を意味するかを判断する人に説明することは、ここにある証拠のなかで、自動化に最も触れられていない仕事の部分である。
こうした職は技術的な深さよりも領域の知識と伝える力を評価し、報酬が異なることがある。
一緒に働いている意思決定者の一人に、あなたの最近の結果のどれが判断を変えたか、そしてなぜかを尋ねること。
よくある問い#
現在の証拠からは、そうはならない。AIエージェントは分析コードの多くを書けるが、公開ベンチマークでは最良のものでも現実的なデータ分析タスクの約三分の一しか解けず、最も弱いのは因果推論である。モデルに関する規則は、独立した人がモデルにチャレンジし監査することを期待しており、米国の予測はデータサイエンティストの職が増えると見ている。変わるのは中身の配分である——手で書くコードは減り、問いを立て、確かめ、説明することが増える。
それに年数で答えることはしない。代わりに見ていられる信号がある——ベンチマークの因果と実験の問いで、AIエージェントが人に並びはじめるかどうか。そして、モデルに関する規則が、独立した人によるチャレンジを求めなくなるかどうか。前者は今日成り立っておらず、後者はいまの方向とは逆である。
実際のコンペから取ったデータ分析466件とデータモデリング74件のベンチマーク DSBench では、最良のエージェントが分析タスクの約34%を解いた。DA-Code では最良のモデルの正答率が約30.5%、統計と因果の問いのベンチマーク QRData では最も強いモデルが58%だった。ベンチマークはすぐに古くなるが、エージェントがどこで最も強く、どこで苦戦するかを示している。
米国の予測は、データサイエンティストの雇用が2025年から2035年に35%増え、平均をはるかに上回ると見ている。仕事の中身は、問いを立てること、実験を設計すること、モデルを検証・監査すること、結果を説明することへと移りつつある——エージェントが最も弱く、規則が人を求めている部分である。
これらの判断が載っているもの#
このページの 6 件の業務判断のうち 2 件は検証済みの事象に支えられ、4 件はプラットフォームの推論であり、いずれもそれが現れる場所に明示されている。その背後には 2 の技術次元、言語モデルが一般に届いて以降の推移の再構成、そして 7 件の検証済み事象がある。
同じ機能のなかの他の職種#
会社はまず仕事を機能に分け、そのあとで職に分ける。以下はこの仕事と同じ「技術とデータ」のなかにある職種である。これは組織図についての事実であって、互いに似ているとか、同じ方向へ変わりつつあるという判断ではない。
初級ソフトウェアエンジニア · 経験のあるソフトウェアエンジニア · フロントエンド開発者 · バックエンド開発者 · データエンジニア · 機械学習エンジニア · AI研究者 · ソフトウェアテスター/QAエンジニア · データアナリスト · ビジネスアナリスト · 業務システムオーナー · 情報システムの支援担当・ヘルプデスク · セキュリティアナリスト(監視運用) · DevOps・プラットフォーム・SRE エンジニア · ネットワークエンジニア · テクニカルライター・ドキュメント担当
