Capacité techniqueAutomatisation cognitive2023-12-10
GPT-4 a réussi 43,5 % des problèmes rédigés par des humains au premier essai sur VerilogEval, un banc d'essai de 156 problèmes de description matérielle qui laisse de côté puissance, performance et surface
Ingénieur électricien / électronicienpage du métier →Date de l'événement / signalement
2023-12-10
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Conception de circuits, de cartes et de puces
Concevoir des circuits analogiques et numériques, écrire du code de description matérielle, et implanter cartes et puces.
Augmentée≈ Estimation de la plateforme
Où ceci s'applique
Un banc d'essai de 156 problèmes tirés du site pédagogique Verilog HDLBits, dont l'exactitude fonctionnelle est vérifiée par simulation par rapport à une solution de référence. Dans les résultats corrigés de la v2, GPT-4 a réussi 43,5 % des problèmes rédigés par des humains au premier essai et 58,9 % en dix essais ; GPT-3.5 en a réussi 26,7 %. Les auteurs notent qu'une grande partie de la conception matérielle tourne autour de l'optimisation de la puissance, de la performance et de la surface, ce que le banc d'essai ne mesure pas. Il teste de courts problèmes pédagogiques avec des modèles de 2023 ; l'employeur des auteurs conçoit des puces et développe de l'IA pour la conception de puces.
Ce que cela veut dire
Les modèles savent écrire du code matériel fonctionnel pour une minorité de problèmes de type manuel au premier essai. Le travail de conception qui compte le plus en pratique — tenir la puissance, la performance et la surface — n'est pas ce que cela mesure, et il reste à l'ingénieur.
Ce que cela ne montre pas encore
De courts problèmes pédagogiques avec des modèles de 2023 ; cela ne mesure ni de vrais projets de puces, ni les modèles actuels.
Ce que vous pouvez vérifier
Ouvrez arXiv 2309.07544 (VerilogEval), lisez le résumé (156 problèmes tirés de HDLBits), puis le tableau II du PDF de la v2.
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Liu et al. (NVIDIA) — VerilogEval: Evaluating Large Language Models for Verilog Code Generation, arXiv 2309.07544 (v2, 10 Dec 2023) · vérifié 2026-09-29 · Claude (VOLO agent) · interprété 2026-09-29 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.