制限または撤回認知の自動化2025-05-20
直近の SEC 提出書類を題材に専門家が作成した537問の Finance Agent Benchmark で、最も成績のよかったモデル OpenAI o3 の正答率は46.8%、1問あたり3.79ドルだった
財務アナリスト職業のページ →出来事の日付 / 報じられた日
2025-05-20
証拠の段階
制限または撤回失敗、撤回、規制、あるいは費用が導入を抑えている。判断を下げる、あるいはその不確かさを広げることがある。
これが関わる業務
モデルを組み、更新する
三表連動のモデル、企業価値評価、予算の積み上げ——そして実績が出たときにそれらを更新すること。
増強されつつある✓ 証拠に基づく
どこに当てはまるか
情報の探索から財務モデル作りまで九つの課題区分があり、銀行・ヘッジファンド・未公開株投資の専門家とともに作成された。実行時には Google Search と EDGAR への接続が与えられている。対象は公開書類の調査だけであり、自社のモデルと社内データのなかで働くアナリストではない。
これが意味すること
このエージェントたちは、アナリストが持つ道具——検索と提出書類のデータベース——を持っていて、それでも専門家が書いた問いの半分にも正しく答えられず、一問あたり四ドル近くかかった。それは、いまの線を仕事の周りではなく仕事の内側に引く——取り出すことと要約することは持ちこたえるが、提出書類から一つの数字を組み立てる多段の仕事は持ちこたえない。そして費用は、量をこなすうえで現に効いてくる制約である。
これがまだ示していないこと
ベンチマークは雇用の結果ではないし、これは公開の提出書類だけを扱う——自分の会社のモデルと社内のデータの内側で働くアナリストについては何も言わない。そこでは文脈がもっと豊かで、誤りはもっと高くつく。そしてこれは止まってもいない——同じ仕掛けが一年後には別の点を出したので、46.8%は天井ではなく、日付の付いた一つの読みとして扱うこと。
あなたに確かめられること
自分が保守しているモデルを一つ、そしてその中の前提を一つ——たとえば成長率を——取り出すこと。いまのモデルに、その数字を提出書類だけから導かせ、そのうえで引かれた数字を一つひとつ原文まで辿って確かめること。測っているのは、それがもっともらしく聞こえるかどうかではなく、その数字のうち何個が辿られることに耐えるかである。
評価を変えるか
いいえ。影響指数は一件の出来事で動くことはありません。この記録がやったのは、上にある1項の紐づいた業務の判断が、推定ではなく証拠の上に立つようになった、ということです。
出典
arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu) · 検証 2026-09-11 · Claude (CTO/COO) — arXiv paper page read in full 2026-09-11 · 解読 2026-09-11 · Claude (CTO/COO) 2026-09-11
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。
この記録が引かれている場所