ContrainteAutomatisation cognitive2025-05-20
Sur le Finance Agent Benchmark — 537 questions rédigées par des experts à partir de documents récents déposés auprès de la SEC — le meilleur modèle, o3 d'OpenAI, a atteint 46.8 % d'exactitude à 3.79 dollars la requête
Analyste financierpage du métier →Date de l'événement / signalement
2025-05-20
Stade de la preuve
ContrainteUn échec, un retour en arrière, une réglementation ou un coût freine l'adoption. Cela peut abaisser une appréciation ou élargir son incertitude.
Tâches concernées
Construire et mettre à jour les modèles
Modèles à trois états financiers, valorisation, consolidation budgétaire — et leur mise à jour à l'arrivée des réalisés.
Augmentée✓ Appuyé sur des preuves
Où ceci s'applique
Neuf catégories de tâches, de la recherche d'information à la modélisation financière, rédigées avec des experts de banques, de fonds spéculatifs et de capital-investissement ; les agents avaient accès à Google Search et à EDGAR. Recherche sur documents publics uniquement — non un analyste travaillant dans les modèles et les données internes de sa propre maison.
Ce que cela veut dire
Les agents avaient les outils d'un analyste — la recherche et la base des documents déposés — et n'ont pourtant réussi moins de la moitié des questions rédigées par des experts, à près de quatre dollars la requête. Cela place la ligne actuelle à l'intérieur du métier plutôt qu'autour de lui : la recherche et la synthèse tiennent, le travail en plusieurs étapes qui consiste à bâtir un chiffre depuis un document ne tient pas, et le coût est une contrainte réelle à grande échelle.
Ce que cela ne montre pas encore
Un banc d'essai n'est pas un résultat d'emploi, et celui-ci ne porte que sur des documents publics — il ne dit rien d'un analyste travaillant dans les modèles et les données internes de sa maison, où le contexte est plus riche et les erreurs plus coûteuses. Il ne reste pas non plus immobile : le même montage a obtenu un score différent un an plus tard, donc prenez les 46.8 % pour une lecture datée, non pour un plafond.
Ce que vous pouvez vérifier
Prenez un modèle que vous entretenez et une hypothèse à l'intérieur — le taux de croissance, par exemple. Demandez à un modèle actuel de dériver ce chiffre des seuls documents déposés, puis vérifiez chaque chiffre qu'il cite en remontant au document. Ce que vous mesurez n'est pas si cela sonne juste mais combien de ses chiffres survivent au fait d'être tracés.
Cela change-t-il l'évaluation ?
Non. L'indice d'impact n'est jamais déplacé par un seul événement. Ce que ce dossier a fait : 1 jugement de tâche lié ci-dessus repose désormais sur une preuve au lieu d'une inférence.
Source
arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu) · vérifié 2026-09-11 · Claude (CTO/COO) — arXiv paper page read in full 2026-09-11 · interprété 2026-09-11 · Claude (CTO/COO) 2026-09-11
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.
Ce dossier est cité dans