Capacidad técnicaAutomatización cognitiva2025-06-17
Los modelos más avanzados resolvieron como máximo el 34% de los problemas de generación de código en un banco de pruebas escrito por ingenieros de hardware experimentados, y las tareas de verificación resultaron especialmente difíciles
Ingeniero de diseño de chipspágina de la ocupación →Fecha del hecho / publicación
2025-06-17
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Escribir RTL
Escribir el código de descripción de hardware (Verilog, VHDL) que describe la lógica de cada bloque.
Aumentada por la máquina≈ Inferencia de la plataforma
Verificación y depuración
Construir testbenches, ejecutar simulaciones y averiguar por qué un diseño no se comporta según la especificación.
Aumentada por la máquina≈ Inferencia de la plataforma
Dónde aplica esto
Un banco de pruebas de 783 problemas en 13 categorías de tareas —generación de RTL, verificación, depuración, alineación con la especificación y preguntas técnicas— redactados por ingenieros de hardware experimentados, en formatos no agénticos y agénticos. Los modelos más avanzados no pasaron del 34% de pass@1 en generación de código, y las tareas agénticas, sobre todo las de reutilización de RTL y verificación, resultaron especialmente difíciles. Un conjunto de pruebas con modelos de 2025; el empleador de los autores diseña chips.
Qué significa esto
En problemas más difíciles y realistas, los mejores modelos fallan la mayor parte de la generación de código, y la verificación es aún más difícil.
Qué no muestra todavía
Un banco de pruebas con modelos de 2025; no mide cómo los usan los ingenieros.
Qué puedes comprobar
Abre arXiv 2506.14074 (CVDP) y busca «no more than 34% pass@1 on code generation».
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 2 juicios enlazados de arriba se quedan donde estaban.
Fuente
Pinckney et al. (NVIDIA) — Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification, arXiv 2506.14074 (17 Jun 2025) · verificado 2026-09-30 · Claude (VOLO agent) · interpretado 2026-09-30 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.