技術的能力認知の自動化2025-10-05
OpenAI の GDPval ベンチマークは、購買担当の実際の成果物を集め、業界の専門家にモデルの出力とそれとを伏せたまま比較採点させた
調達・サプライチェーン担当職業のページ →出来事の日付 / 報じられた日
2025-10-05
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
供給元を見つけ、比べる
これを誰が、いくらで、どの仕様で、いつまでに作れるか。
自動化されつつある≈ 本サイトの推定
発注と書類
発注を起こし、請求書と入荷と突き合わせ、食い違いを追いかける。
自動化されつつある≈ 本サイトの推定
どこに当てはまるか
バイヤーと購買担当は、このベンチマークに含まれる米国の44職業の一つであり、対象は米国の国内総生産に最も寄与する九つの分野にまたがる。全体で1,320件の課題があり、一職業あたり少なくとも30件。それぞれが、平均14年の経験を持つ専門職の実際の成果物からつくられ、その職業の作業活動の大半を覆っている。採点されるのは成果物であり、一発勝負で、伏せたままの一対比較による——職ではない。依頼人もおらず、手直しの回もなく、交渉もなく、間違ったときの結果もない。見出しの数字(あるモデルの選抜分の成果物のうち47.6%が、専門家のものと同等以上と評価された)は2025年9月時点のモデル世代のものであり、すでに置き換えられている。より役に立つのは、論文が、勝率は0-2時間の課題で最も高く、課題が長くなるにつれて着実に下がると報告している点である。職業別の数字は図としてのみ公表されているので、購買に固有の数字はここには引いていない。OpenAI はこのベンチマークを設計し、走らせ、そしてそれで測られるモデルを売っている。
これが意味すること
誰かがついに、この仕事が何を生み出すのかを、公けに、誰でもモデルを当てて試せる形で書き下ろした——十年を超える経験のある実務家による、三十点あまりの実在の購買の成果物である。この職業が、ソフトウェアの売り先以外の何かとして公けの記録に現れたのは、これが初めてである。点数よりもその記述のほうを読む価値がある——このベンチマークは、この仕事のうち文書を生む半分が実際に何でできているかの一覧である。
これがまだ示していないこと
モデルが自分の仕事をやっていることを示すものではないし、このベンチマークの著者たちもそう主張していない。GDPval の課題は完全に指定された形で、参照するファイルを添えて届き、一度採点される。この職業のうち成果物ではない部分——ある供給元がもうすぐ倒れると知っていること、誰に足りない分を我慢してもらうかを決めること、工場長が真夜中に電話してくる相手であること——はそこに入っていないし、入れるつもりもなかった。どこかの雇用主が何かを変えたとも言っていない——これは capability の尺度であり、capability は導入ではない。
あなたに確かめられること
先月の仕事を取り出し、二つの山に分けること——誰かが読む文書で終わったものと、決定か電話で終わったもの。GDPval が試しているのは前者の山だけである。自分の二つの山の比こそ知るべきものであり、そしてほかの誰にも計算してもらえない。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある2項の紐づいた判断は、元の位置のままです。
出典
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (OpenAI, arXiv:2510.04374) · 検証 2026-09-12 · Claude (VOLO agent) — PDF downloaded from arXiv and read; the 44-occupation table, the 1,320/30-per-occupation counts, the 14-year figure, the 47.6% headline and the task-duration gradient each located in the paper's own text · 解読 2026-09-12 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。
この記録が引かれている場所