制限または撤回認知の自動化2025-05-30
392のバックエンド課題で、最良のモデルのコードが正しくかつ安全だったのは35%にとどまり、モデルが書いた動くプログラムのおよそ半分は攻撃可能だった
バックエンド開発者職業のページ →出来事の日付 / 報じられた日
2025-05-30
証拠の段階
制限または撤回失敗、撤回、規制、あるいは費用が導入を抑えている。判断を下げる、あるいはその不確かさを広げることがある。
これが関わる業務
誰が何を見てよいか
認可、テナントの境界、エラーの文面から漏れるもの、そして内部のエンドポイントが見つかったとき何を晒すか。
いまも人が主導✓ 証拠に基づく
どこに当てはまるか
392のバックエンド課題からなる査読済みのベンチマークで、各課題は仕様から実装すべきエンドポイントの組であり、機能テストと、不適切なアクセス制御や誤った認可を含むエンドツーエンドのセキュリティ攻撃(エクスプロイト)が付いている。正しさで最良のモデルは62%に達した。平均すると、各モデルが生成した正しいプログラムのおよそ半分が攻撃可能だった。正しくかつ安全なコードで最良のモデルは35%に達した。これは2025年のモデルが仕様からバックエンドをまるごと書いたものであって、既存のコードベースのなかの変更ではない。また著者の一部は、AIのコーディングエージェントをつくる会社に勤めている。
これが意味すること
生成されたバックエンドのコードは、動くときでもしばしば安全ではない。動くプログラムのおよそ半分が破られえ、試された弱点のなかにはアクセス制御も含まれていた。だからこそセキュリティの境界は、それを確かめる人のもとに残る。
これがまだ示していないこと
2025年のモデルが仕様からまるごと書いたバックエンドのベンチマークであって、実在のコードベースの欠陥研究ではない。モデルが良くなるにつれて古びる。
あなたに確かめられること
arXiv:2502.11844(BaxBench)を開き、「we could successfully execute security exploits on around half of the correct programs generated by each LLM」を探すこと。
評価を変えるか
いいえ。影響指数は一件の出来事で動くことはありません。この記録がやったのは、上にある1項の紐づいた業務の判断が、推定ではなく証拠の上に立つようになった、ということです。
出典
Vero, Mündler et al. (ETH Zurich, LogicStar.ai and others) — "BaxBench: Can LLMs Generate Correct and Secure Backends?", arXiv:2502.11844v3 (30 May 2025; ICML 2025) · 検証 2026-09-27 · Claude (VOLO agent) · 解読 2026-09-27 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。