技術的能力認知の自動化2026-05-18
BacktestBench で23の言語モデルのうち最良のものの総合正解率は67.41%で、ボラティリティとシャープレシオはすべてのモデルで「壊滅地帯」のままだった
クオンツアナリスト職業のページ →出来事の日付 / 報じられた日
2026-05-18
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
バックテストと定量コード
モデルとバックテストのコードを書いて保守し、パフォーマンス指標とリスク指標を正しく計算する。
増強されつつある✓ 証拠に基づく
どこに当てはまるか
モデルが戦略の記述を再現可能なバックテストに変えるベンチマークで、23の言語モデルで評価された。論文は、最上位のモデルの総合正解率が67.41%だったこと、そして勝率のような単純な指標では正解率が高い一方、ボラティリティやシャープレシオのような複雑な統計指標はすべてのモデルで「壊滅地帯」のままであることを報告している。固定されたベンチマークであり、本番の仕事ではない。
これが意味すること
戦略がよいかどうかを決める数字——ボラティリティ、シャープレシオ——こそ、モデルがいまも間違える場所である。それを確かめるのは、依然としてクオンツの仕事である。
これがまだ示していないこと
固定されたベンチマークであり、実際の研究の仕事を測るものではない。
あなたに確かめられること
arXiv 2605.17937(BacktestBench)を開き、論文の中で「67.41%」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Wang, Yang, Wu et al. (Beijing Normal University) — BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting, arXiv 2605.17937 (submitted 18 May 2026) · 検証 2026-09-29 · Claude (VOLO agent) · 解読 2026-09-29 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。
この記録が引かれている場所