Capacidade técnicaAutomatização cognitiva2024-02-02
Num benchmark de planeamento de viagens do mundo real, o GPT-4 cumpriu todas as restrições em apenas 0,6% dos casos, concluíram investigadores
Agente / consultor de viagenspágina da profissão →Data do facto / publicação
2024-02-02
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Montar itinerários complexos
Encaixar voos, hotéis, transferes e orçamentos num só plano que cumpra todas as restrições.
Aumentada pela máquina✓ Com prova
Onde é que isto se aplica
Um benchmark em que agentes de linguagem têm de planear viagens com muitas restrições usando ferramentas. Os autores relatam que os agentes de linguagem ainda não são capazes de tarefas de planeamento tão complexas — até o GPT-4 atingiu uma taxa de sucesso de 0,6% — e que os agentes têm dificuldade em manter-se na tarefa, usar as ferramentas certas ou acompanhar múltiplas restrições. Um ambiente de teste com modelos de 2023–24.
O que isto significa
Manter ao mesmo tempo todas as restrições de uma viagem inteira é exatamente aquilo em que os modelos de linguagem eram piores.
O que ainda não mostra
Um benchmark com modelos de 2023–24; os sistemas mais recentes saem-se melhor, como mostram trabalhos posteriores.
O que podes verificar
Abre o arXiv 2402.01622 e procura «success rate of 0.6%».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 1 juízo ligado em cima ficam onde estavam.
Fonte
Xie et al. — TravelPlanner: A Benchmark for Real-World Planning with Language Agents (arXiv 2402.01622, submitted 2 Feb 2024) · verificado 2026-09-30 · Claude (VOLO agent) · interpretado 2026-09-30 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.