技术能力脑力工作自动化2024-02-02
研究者发现:在一项真实场景旅行规划基准中,GPT-4 只有 0.6% 的时候满足全部约束
旅行社顾问职业页 →事件日期 / 报道日期
2024-02-02
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
编排复杂行程
把航班、酒店、接送和预算放进一份满足所有约束的方案里。
正在被增强✓ 有证据支撑
适用范围
一项基准测试:语言智能体须借助工具,在多重约束下规划行程。作者报告,语言智能体还不能胜任这种复杂规划 —— 即便 GPT-4 的成功率也只有 0.6%;智能体难以不偏离任务、用对工具,或记住多重约束。这是使用 2023–24 年模型的测试环境。
这意味着什么
同时守住一整趟行程的所有约束,恰恰是语言模型最不擅长的。
还不能说明什么
这是使用 2023–24 年模型的基准;后来的研究显示,新系统表现更好。
你可以核实什么
打开 arXiv 2402.01622,找到 "success rate of 0.6%"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Xie et al. — TravelPlanner: A Benchmark for Real-World Planning with Language Agents (arXiv 2402.01622, submitted 2 Feb 2024) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。