Capacité techniqueAutomatisation cognitive2026-05-18
Sur BacktestBench, le meilleur de 23 modèles de langage a atteint 67,41 % d'exactitude globale, et la volatilité comme le ratio de Sharpe sont restés des « zones sinistrées » pour tous
Analyste quantitatifpage du métier →Date de l'événement / signalement
2026-05-18
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Backtests et code quantitatif
Écrire et maintenir le code des modèles et des backtests, et calculer correctement les métriques de performance et de risque.
Augmentée✓ Appuyé sur des preuves
Où ceci s'applique
Un banc d'essai dans lequel des modèles transforment des descriptions de stratégies en backtests reproductibles, évalué sur 23 modèles de langage. L'article indique que le meilleur modèle a atteint une exactitude globale de 67,41 %, et que si des métriques plus simples comme le taux de réussite obtiennent une meilleure exactitude, des indicateurs statistiques complexes comme la volatilité et le ratio de Sharpe restent des « zones sinistrées » pour tous les modèles. C'est un banc d'essai figé, non un travail en production.
Ce que cela veut dire
Les chiffres qui décident si une stratégie vaut quelque chose — volatilité, ratio de Sharpe — sont précisément là où les modèles se trompent encore. Les vérifier reste le travail d'un quant.
Ce que cela ne montre pas encore
Un banc d'essai figé ; il ne mesure pas le vrai travail de recherche.
Ce que vous pouvez vérifier
Ouvrez arXiv 2605.17937 (BacktestBench) et cherchez « 67.41% » dans l'article.
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Wang, Yang, Wu et al. (Beijing Normal University) — BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting, arXiv 2605.17937 (submitted 18 May 2026) · vérifié 2026-09-29 · Claude (VOLO agent) · interprété 2026-09-29 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.
Ce dossier est cité dans