技術的能力認知の自動化2024-02-02
実世界の旅行計画のベンチマークで、GPT-4がすべての制約を満たしたのは0.6%にとどまった、と研究者らは明らかにした
旅行代理店スタッフ・旅行アドバイザー職業のページ →出来事の日付 / 報じられた日
2024-02-02
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
複雑な旅程を組む
航空便、ホテル、送迎、予算を、すべての制約を満たす一つの計画にまとめること。
増強されつつある✓ 証拠に基づく
どこに当てはまるか
言語エージェントがツールを使い、多くの制約のもとで旅行を計画しなければならないベンチマーク。著者らは、言語エージェントはまだこのような複雑な計画の課題をこなせない——GPT-4でさえ成功率は0.6%だった——と報告し、エージェントは課題から外れずにいること、適切なツールを使うこと、複数の制約を把握し続けることに苦労するとしている。2023〜24年のモデルによるテスト環境である。
これが意味すること
旅行全体の制約を同時に保つことは、まさに言語モデルが最も苦手としていたことである。
これがまだ示していないこと
2023〜24年のモデルによるベンチマークである。後の研究が示すとおり、新しいシステムはもっとよくできる。
あなたに確かめられること
arXiv 2402.01622 を開き、「success rate of 0.6%」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Xie et al. — TravelPlanner: A Benchmark for Real-World Planning with Language Agents (arXiv 2402.01622, submitted 2 Feb 2024) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。