Capacité techniqueAutomatisation cognitive2025-06-17
Les modèles les plus avancés n'ont pas réussi plus de 34 % des problèmes de génération de code d'un banc d'essai rédigé par des ingénieurs matériel expérimentés, et les tâches de vérification se sont révélées particulièrement difficiles
Ingénieur en conception de pucespage du métier →Date de l'événement / signalement
2025-06-17
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Écrire le RTL
Écrire le code de description matérielle (Verilog, VHDL) qui décrit la logique de chaque bloc.
Augmentée≈ Estimation de la plateforme
Vérification et débogage
Construire des bancs de test, lancer des simulations et chercher pourquoi une conception ne se comporte pas comme spécifié.
Augmentée≈ Estimation de la plateforme
Où ceci s'applique
Un banc d'essai de 783 problèmes répartis en 13 catégories de tâches — génération de RTL, vérification, débogage, alignement sur la spécification et questions techniques — rédigés par des ingénieurs matériel expérimentés, sous des formes non agentiques et agentiques. Les modèles les plus avancés n'ont pas dépassé 34 % de pass@1 en génération de code, et les tâches agentiques, en particulier celles qui impliquent la réutilisation de RTL et la vérification, se sont révélées particulièrement difficiles. Un jeu de test avec des modèles de 2025 ; l'employeur des auteurs conçoit des puces.
Ce que cela veut dire
Sur des problèmes plus difficiles et réalistes, les meilleurs modèles échouent à la plupart des générations de code, et la vérification est plus difficile encore.
Ce que cela ne montre pas encore
Un banc d'essai avec des modèles de 2025 ; cela ne mesure pas la manière dont les ingénieurs les utilisent.
Ce que vous pouvez vérifier
Ouvrez arXiv 2506.14074 (CVDP) et cherchez « no more than 34% pass@1 on code generation ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 2 jugements liés ci-dessus restes là où il était.
Source
Pinckney et al. (NVIDIA) — Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification, arXiv 2506.14074 (17 Jun 2025) · vérifié 2026-09-30 · Claude (VOLO agent) · interprété 2026-09-30 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.