技術的能力認知の自動化2023-08-10
RTLLM の30件の大きめの設計タスクで、GPT-4 は機能的に正しい設計を15件出した。五回の試行のうち一回でもテストベンチを通れば正しいと数えている
チップ設計エンジニア職業のページ →出来事の日付 / 報じられた日
2023-08-10
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
RTLを書く
各ブロックの論理を記述するハードウェア記述のコード(Verilog、VHDL)を書く。
増強されつつある≈ 本サイトの推定
どこに当てはまるか
30の設計からなる学術的なベンチマークで、以前のテストが比較的単純で小さく、著者自身が提案した設計を使っていたことから作られた。構文、機能、設計の質を採点する。GPT-4 は構文の正しさ81%、機能の正しさ30件中15件を達成した。ここでは、五回の試行のいずれかがテストベンチを通れば、その設計は機能的に正しいと数える。2023年時点のモデルであり、チップの案件での利用は測っていない。
これが意味すること
大きめの設計では、モデルが単独で取り組むと、それぞれ五回試しても正しくできるのは約半分である。
これがまだ示していないこと
30の設計についての2023年のベンチマークである。実際の案件での消費電力・性能・面積は測っていない。
あなたに確かめられること
arXiv 2308.05345(RTLLM)を開き、PDF で「81% correct syntax and 15/30 correct functionalities」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Lu, Liu, Zhang, Xie (HKUST) — RTLLM: An Open-Source Benchmark for Design RTL Generation with Large Language Model, arXiv 2308.05345 (v1, 10 Aug 2023) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。