技术能力脑力工作自动化2026-05-18
在 BacktestBench 上,23 个语言模型中最好的整体准确率为 67.41%,波动率和夏普比率在所有模型上都仍是「重灾区」
量化分析师职业页 →事件日期 / 报道日期
2026-05-18
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
回测与量化代码
编写和维护模型与回测的代码,并正确计算表现与风险指标。
正在被增强✓ 有证据支撑
适用范围
这是一项基准:模型要把策略描述转成可复现的回测,评估了 23 个语言模型。论文报告:最好的模型整体准确率为 67.41%;胜率等较简单的指标准确率较高,而波动率、夏普比率等复杂统计指标在所有模型上都仍是「重灾区」。它是固定基准,不是生产工作。
这意味着什么
决定一个策略好不好的那些数字 —— 波动率、夏普比率 —— 恰恰是模型仍然出错的地方。核对它们仍是量化人员的工作。
还不能说明什么
这是固定基准;没有测量真实的研究工作。
你可以核实什么
打开 arXiv 2605.17937(BacktestBench),在论文中找到 "67.41%"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Wang, Yang, Wu et al. (Beijing Normal University) — BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting, arXiv 2605.17937 (submitted 18 May 2026) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。
这条记录被引用在