技術的能力認知の自動化2026-02-12
最先端のモデルは369項目の財務報告スキーマで有効な出力が0%となり、ある分野では有効な出力が90%でも合格率は12.5%にとどまった、と ExtractBench の著者らは報告した
データ入力オペレーター職業のページ →出来事の日付 / 報じられた日
2026-02-12
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
記録の確認と訂正
入力されたデータを元の資料と照らし合わせ、誤りを直す。
増強されつつある✓ 証拠に基づく
どこに当てはまるか
人が付与した正解ラベルつきの35件の PDF 文書から構造化データを抽出するベンチマークで、項目は合わせて12,867ある。著者らによれば、最先端のモデルは現実的なスキーマではなお信頼できず、スキーマが広がるほど性能は急激に落ち、369項目の財務報告スキーマでは試したすべてのモデルで有効な出力が0%に至った。また、ある分野ではモデルが90%の有効な出力を出すものの、合格率は12.5%にとどまった。著者らは文書製品を売る会社に勤めている。これはベンチマークであり、実務の測定ではない。
これが意味すること
機械による抽出は長く複雑な書式で崩れ、有効に見える出力でも間違っていることがある——キー入力が自動化されても確認が生き残るのはそのためである。
これがまだ示していないこと
利害を持つ会社によるベンチマークである。モデルは改善していき、また実務でどれだけ確認が行われているかは測っていない。
あなたに確かめられること
arXiv の ExtractBench の論文(2602.12247)を開き、「0% valid output」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Ferguson, Pennington, Beghian, Mohan, Kiela, Agrawal and Nguyen (Contextual AI) — ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction, arXiv:2602.12247 (submitted 12 Feb 2026) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。