RestriçãoAutomatização cognitiva2025-05-20
No Finance Agent Benchmark — 537 perguntas escritas por especialistas sobre documentos recentes entregues à SEC — o melhor modelo, o o3 da OpenAI, chegou a 46,8% de acerto a 3,79 dólares por consulta
Analista financeiropágina da profissão →Data do facto / publicação
2025-05-20
Categoria da prova
RestriçãoUma falha, um recuo, uma regulação ou um custo estão a travar a adoção. Pode baixar uma avaliação ou alargar a sua incerteza.
Tarefas sobre as quais incide
Construir e atualizar modelos
Modelos das três demonstrações financeiras, avaliação, consolidação de orçamentos — e atualizá-los quando chegam os valores reais.
Aumentada pela máquina✓ Com prova
Onde é que isto se aplica
Nove categorias de tarefa, da recolha de informação à modelação financeira, escritas com especialistas de bancos, fundos de cobertura e private equity; os agentes tiveram acesso ao Google Search e ao EDGAR. Apenas pesquisa sobre documentos públicos — não um analista a trabalhar dentro dos modelos e dos dados internos da sua própria casa.
O que isto significa
Os agentes tinham as ferramentas que um analista tem (a pesquisa e a base de dados de relatórios) e ainda assim acertaram menos de metade das perguntas escritas por peritos, a quase quatro dólares por consulta. Isso coloca a linha atual dentro do posto e não à sua volta: recuperar e resumir aguentam, o trabalho de vários passos de construir um número a partir de um relatório não, e o custo é uma restrição ativa em volume.
O que ainda não mostra
Um banco de ensaio não é um resultado de emprego, e este é apenas de relatórios públicos: nada diz sobre um analista a trabalhar dentro dos modelos da sua própria firma e com dados internos, onde o contexto é mais rico e os erros saem mais caros. Também não fica parado: o mesmo conjunto pontuou de forma diferente um ano depois, por isso trata os 46,8% como uma leitura datada e não como um teto.
O que podes verificar
Pega num modelo que mantenhas e num pressuposto lá dentro, por exemplo a taxa de crescimento. Pede a um modelo atual que derive esse número apenas a partir dos relatórios, e depois verifica cada número que ele cite contra o documento. O que estás a medir não é se soa bem, mas quantos dos seus números sobrevivem a serem seguidos até à fonte.
Muda a avaliação?
Não. O índice de impacto nunca é movido por um único facto. O que este registo fez: 1 juízo de tarefa ligado em cima apoiam-se agora em prova em vez de em inferência.
Fonte
arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu) · verificado 2026-09-11 · Claude (CTO/COO) — arXiv paper page read in full 2026-09-11 · interpretado 2026-09-11 · Claude (CTO/COO) 2026-09-11
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.
Este registo é citado em