技术能力脑力工作自动化2023-12-10
在 VerilogEval 的 156 道人工编写 Verilog 题上,GPT-4 第一次尝试通过 43.5%;作者说这项基准只限于小规模设计的样板代码
芯片设计工程师职业页 →事件日期 / 报道日期
2023-12-10
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
编写 RTL 代码
编写描述每个模块逻辑的硬件描述代码(Verilog、VHDL)。
正在被增强≈ 平台推断
适用范围
这是一项基准,包含来自 Verilog 教学网站 HDLBits 的 156 道题,通过仿真与标准答案比对来检验功能正确性。在修正后的 v2 结果中,GPT-4 第一次尝试通过了 43.5% 的人工编写题,十次以内通过 58.9%。作者写明,他们的评估只限于相对小规模设计的样板代码生成。这是 2023 年的模型在教学题上的表现;作者的雇主设计芯片。
这意味着什么
模型第一次尝试就能为少数教科书式的题目写出能用的硬件代码。
还不能说明什么
这是 2023 年的模型在简短教学题上的表现;没有测量真实的芯片项目。
你可以核实什么
打开 arXiv 2309.07544(VerilogEval),看 v2 PDF 中的表二。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Liu et al. (NVIDIA) — VerilogEval: Evaluating Large Language Models for Verilog Code Generation, arXiv 2309.07544 (v2, 10 Dec 2023) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。