制限または撤回認知の自動化2026-07-20
実際の企業データ基盤の問い合わせ記録からつくられた text-to-SQL のベンチマーク Beaver では、素の大規模言語モデルの得点は0、自律的に道具を使う構成でおよそ10%だった。公開ベンチマークでの80-90%超に対して
データアナリスト職業のページ →出来事の日付 / 報じられた日
2026-07-20
証拠の段階
制限または撤回失敗、撤回、規制、あるいは費用が導入を抑えている。判断を下げる、あるいはその不確かさを広げることがある。
これが関わる業務
問い合わせを書き、ダッシュボードをつくる
「先月Xをした利用者は何人か」を SQL に訳し、その結果を、誰かが更新できる図につなぐ。
自動化されつつある✓ 証拠に基づく
データが嘘をついているときに気づく
壊れた取り込み、二重に記録された事象、時差の不具合、3月に変わった定義を見つける。
いまも人が主導✓ 証拠に基づく
どこに当てはまるか
このベンチマークの著者自身が書いたものであり、著者らは競合する系(Rubicon)も売り込んでいる——つまりここでの利害関係者は「簡単なベンチマークのほうが間違っている」と論じている。もとになっている主張は確かめられる。Beaver は MIT の1,400テーブルの Oracle 基盤と他の三つの実際の問い合わせ記録からつくられており、順位表は公開されている。挙げられている四つの理由は、モデルの出来ではなく構造に関わるものである——公開ベンチマークのデータは学習資料に入っている、現実のスキーマは腐って「salary」という名の列が六つに増える、基盤にはその土地固有の言い回しがある、そして現実の問い合わせは一つではなく二つ三つのテーブルを結合する。
これが意味すること
公開のベンチマークでの90%と、実際の倉庫での10%の差は、次の版で直るモデルの問題ではない。実際の企業のデータの形そのものである。過去三つのテキストからSQLへの製品を自分の仕事が生き延びた理由が、ここに書かれている——腐ったスキーマ、その場だけの言い回し、そして salary という名の列が六つあって、どれがどれかを知っているのは自分だけだという事実である。その知識こそが仕事であり、SQLよりもそちらのほうが多くを占めている。
これがまだ示していないこと
一つのベンチマーク、四つの倉庫、そして著者たちは代わりの仕組みを売っている。ここには、どこかの会社がアナリストを残したとも、この種の道具を買うのをやめたとも書かれていない——90%という数字で買われるソフトウェアはいくらでもある。この結果はどの倉庫にも当てはまるわけでもない——この記事自身の結論は、素直な問い合わせとその場だけの言い回しの少ない、きれいなスキーマなら働く、というものであり、それは比較的新しい小ぶりのデータ基盤の多くに当てはまる。
あなたに確かめられること
どちらの数字も信じずに、自分の倉庫でこの試験をやること。前四半期の依頼から実際の問いを十個取り、モデルにはスキーマだけを渡し、出てきたSQLを自分が実際に出したものと突き合わせること。どの表を使うかを教えられずに正解したのが何件かを数えること。その数字が、測られた自分の職の安全度であり、それが高く出たなら、文書化する価値のあるものの一覧でもある。
評価を変えるか
いいえ。影響指数は一件の出来事で動くことはありません。上にある2項の紐づいた判断のうち、1項がこの記録によって推定から証拠へ移りました。残る1項は、すでにより早い証拠の上に立っていました。
出典
BLOG@CACM (Stonebraker & Chen, MIT) · 検証 2026-09-11 · Claude (CTO/COO) — source read in full 2026-09-11 · 解読 2026-09-11 · Claude (CTO/COO)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。
この記録が引かれている場所