Capacidad técnicaAutomatización cognitiva2025-06-17
Los modelos más avanzados resolvieron como máximo el 34% de los problemas de generación de código en un banco de pruebas escrito por ingenieros de hardware experimentados, y las tareas de verificación resultaron especialmente difíciles
Ingeniero eléctricopágina de la ocupación →Fecha del hecho / publicación
2025-06-17
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Diseño de circuitos, placas y chips
Diseñar circuitos analógicos y digitales, escribir código de descripción de hardware y distribuir placas y chips.
Aumentada por la máquina≈ Inferencia de la plataforma
Dónde aplica esto
Un banco de pruebas de 783 problemas en 13 categorías de tareas —generación de RTL, verificación, depuración, alineación con la especificación y preguntas técnicas— redactados por ingenieros de hardware experimentados, en formatos no agénticos y agénticos. Los modelos más avanzados no pasaron del 34% de pass@1 en generación de código, y las tareas agénticas, sobre todo las de reutilización de RTL y verificación, resultaron especialmente difíciles. Un conjunto de pruebas con modelos de 2025; el empleador de los autores diseña chips.
Qué significa esto
En problemas más difíciles y realistas, los mejores modelos fallan la mayor parte de la generación de código, y la verificación es aún más difícil.
Qué no muestra todavía
Un banco de pruebas con modelos de 2025; no mide cómo los usan los ingenieros.
Qué puedes comprobar
Abre arXiv 2506.14074 (CVDP) y busca «no more than 34% pass@1 on code generation».
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 1 juicio enlazado de arriba se quedan donde estaban.
Fuente
Pinckney et al. (NVIDIA) — Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification, arXiv 2506.14074 (17 Jun 2025) · verificado 2026-09-30 · Claude (VOLO agent) · interpretado 2026-09-30 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.