技术能力脑力工作自动化2025-06-17
在一项由资深硬件工程师出题的基准上,最先进的模型只通过不超过 34% 的代码生成题,验证类任务尤其困难
电气工程师职业页 →事件日期 / 报道日期
2025-06-17
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
电路、电路板与芯片设计
设计模拟与数字电路,编写硬件描述代码,并完成电路板和芯片的布局。
正在被增强≈ 平台推断
适用范围
这是一项基准,包含 13 类任务共 783 道题 —— RTL 生成、验证、调试、规格对齐和技术问答 —— 由资深硬件工程师出题,分非智能体和智能体两种形式。最先进的模型在代码生成上第一次尝试的通过率不超过 34%;智能体任务,尤其是涉及复用 RTL 和验证的任务,尤其困难。这是 2025 年的模型在测试集上的表现;作者的雇主设计芯片。
这意味着什么
在更难、更贴近实际的题目上,最好的模型在代码生成上多数失败,验证更难。
还不能说明什么
这是 2025 年的模型在基准上的表现;没有测量工程师怎样使用它们。
你可以核实什么
打开 arXiv 2506.14074(CVDP),找到 "no more than 34% pass@1 on code generation"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Pinckney et al. (NVIDIA) — Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification, arXiv 2506.14074 (17 Jun 2025) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。