技术能力脑力工作自动化2025-06-17
在一项由资深硬件工程师出题的基准上,最先进的模型只通过不超过 34% 的代码生成题,验证类任务尤其困难
芯片设计工程师职业页 →事件日期 / 报道日期
2025-06-17
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
编写 RTL 代码
编写描述每个模块逻辑的硬件描述代码(Verilog、VHDL)。
正在被增强≈ 平台推断
验证与调试
搭建测试平台、跑仿真,并查清设计为什么没有按规格工作。
正在被增强≈ 平台推断
适用范围
这是一项基准,包含 13 类任务共 783 道题 —— RTL 生成、验证、调试、规格对齐和技术问答 —— 由资深硬件工程师出题,分非智能体和智能体两种形式。最先进的模型在代码生成上第一次尝试的通过率不超过 34%;智能体任务,尤其是涉及复用 RTL 和验证的任务,尤其困难。这是 2025 年的模型在测试集上的表现;作者的雇主设计芯片。
这意味着什么
在更难、更贴近实际的题目上,最好的模型在代码生成上多数失败,验证更难。
还不能说明什么
这是 2025 年的模型在基准上的表现;没有测量工程师怎样使用它们。
你可以核实什么
打开 arXiv 2506.14074(CVDP),找到 "no more than 34% pass@1 on code generation"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 2 项关联判断维持原状。
来源
Pinckney et al. (NVIDIA) — Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification, arXiv 2506.14074 (17 Jun 2025) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。