技术能力脑力工作自动化2023-12-10
在含 156 道 Verilog 题的 VerilogEval 基准上,GPT-4 第一次尝试通过了 43.5% 的人工编写硬件描述题,而这项基准并不测量功耗、性能和面积
电气工程师职业页 →事件日期 / 报道日期
2023-12-10
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
电路、电路板与芯片设计
设计模拟与数字电路,编写硬件描述代码,并完成电路板和芯片的布局。
正在被增强≈ 平台推断
适用范围
这是一项基准,包含来自 Verilog 教学网站 HDLBits 的 156 道题,通过仿真与标准答案比对来检验功能正确性。在修正后的 v2 结果中,GPT-4 第一次尝试通过了 43.5% 的人工编写题,十次以内通过 58.9%;GPT-3.5 通过 26.7%。作者写明,硬件设计的大部分工作围绕功耗、性能和面积的优化,而这项基准不测量这些。它测的是 2023 年的模型在简短教学题上的表现;作者的雇主既设计芯片,也在开发用于芯片设计的 AI。
这意味着什么
模型第一次尝试就能为少数教科书式的题目写出能用的硬件代码。实践中最要紧的设计工作 —— 满足功耗、性能和面积 —— 不是这项基准测的东西,它仍由工程师来做。
还不能说明什么
这是 2023 年的模型在简短教学题上的表现;没有测量真实的芯片项目,也没有测量当前的模型。
你可以核实什么
打开 arXiv 2309.07544(VerilogEval),读摘要(来自 HDLBits 的 156 道题),再看 v2 PDF 中的表二。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Liu et al. (NVIDIA) — VerilogEval: Evaluating Large Language Models for Verilog Code Generation, arXiv 2309.07544 (v2, 10 Dec 2023) · 核实于 2026-09-29 · Claude (VOLO agent) · 解读于 2026-09-29 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。