RestricciónAutomatización cognitiva2025-05-20
En el Finance Agent Benchmark — 537 preguntas escritas por expertos sobre documentos recientes presentados a la SEC — el mejor modelo, o3 de OpenAI, llegó a un 46,8% de acierto a 3,79 dólares por consulta
Analista financieropágina de la ocupación →Fecha del hecho / publicación
2025-05-20
Categoría de la evidencia
RestricciónUn fallo, una marcha atrás, una regulación o un coste están frenando la adopción. Puede bajar una evaluación o ensanchar su incertidumbre.
Tareas sobre las que incide
Construir y actualizar modelos
Modelos de tres estados financieros, valoración, consolidación de presupuestos — y actualizarlos cuando llegan los datos reales.
Aumentada por la máquina✓ Con evidencia
Dónde aplica esto
Nueve categorías de tarea, desde recuperar información hasta modelización financiera, escritas con expertos de bancos, fondos de cobertura y capital riesgo; a los agentes se les dio acceso a Google Search y a EDGAR. Solo investigación sobre documentos públicos — no un analista trabajando dentro de los modelos y los datos internos de su propia firma.
Qué significa esto
Los agentes tenían las herramientas que tiene un analista (la búsqueda y la base de datos de informes) y aun así acertaron menos de la mitad de las preguntas escritas por expertos, a casi cuatro dólares por consulta. Eso sitúa la línea actual dentro del puesto y no alrededor de él: recuperar y resumir aguantan, el trabajo de varios pasos de construir una cifra a partir de un informe no, y el coste es una restricción viva en volumen.
Qué no muestra todavía
Un banco de pruebas no es un resultado de empleo, y este es solo de informes públicos: no dice nada de un analista trabajando dentro de los modelos de su propia firma y con datos internos, donde el contexto es más rico y los errores salen más caros. Tampoco se queda quieto: el mismo montaje puntuó distinto un año después, así que trata el 46,8% como una lectura fechada y no como un techo.
Qué puedes comprobar
Coge un modelo que mantengas y un supuesto de dentro, por ejemplo la tasa de crecimiento. Pídele a un modelo actual que derive esa cifra solo a partir de los informes, y después comprueba cada número que cite contra el documento. Lo que estás midiendo no es si suena bien, sino cuántas de sus cifras sobreviven a que se las rastree.
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Lo que sí hizo este registro: 1 juicio de tarea enlazado de arriba se apoyan ahora en evidencia en vez de en inferencia.
Fuente
arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu) · verificado 2026-09-11 · Claude (CTO/COO) — arXiv paper page read in full 2026-09-11 · interpretado 2026-09-11 · Claude (CTO/COO) 2026-09-11
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.
Este registro se cita en