Capacidad técnicaAutomatización cognitiva2023-12-10
GPT-4 resolvió al primer intento el 43,5% de los problemas escritos por personas en VerilogEval, un banco de pruebas de 156 problemas de descripción de hardware que deja fuera potencia, rendimiento y área
Ingeniero eléctricopágina de la ocupación →Fecha del hecho / publicación
2023-12-10
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Diseño de circuitos, placas y chips
Diseñar circuitos analógicos y digitales, escribir código de descripción de hardware y distribuir placas y chips.
Aumentada por la máquina≈ Inferencia de la plataforma
Dónde aplica esto
Un banco de pruebas de 156 problemas del sitio web didáctico de Verilog HDLBits, cuya corrección funcional se comprueba por simulación frente a una solución de referencia. En los resultados corregidos de la v2, GPT-4 resolvió el 43,5% de los problemas escritos por personas al primer intento y el 58,9% en diez intentos; GPT-3.5 resolvió el 26,7%. Los autores señalan que buena parte del diseño de hardware gira en torno a optimizar potencia, rendimiento y área, algo que el banco de pruebas no mide. Evalúa problemas didácticos cortos con modelos de 2023; el empleador de los autores diseña chips y desarrolla IA para el diseño de chips.
Qué significa esto
Los modelos pueden escribir código de hardware que funciona para una minoría de problemas de estilo de manual al primer intento. El trabajo de diseño que más importa en la práctica —cumplir con potencia, rendimiento y área— no es lo que esto mide, y sigue en manos del ingeniero.
Qué no muestra todavía
Problemas didácticos cortos con modelos de 2023; no mide proyectos de chips reales ni modelos actuales.
Qué puedes comprobar
Abre arXiv 2309.07544 (VerilogEval), lee el resumen (156 problemas de HDLBits) y después la tabla II del PDF de la v2.
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 1 juicio enlazado de arriba se quedan donde estaban.
Fuente
Liu et al. (NVIDIA) — VerilogEval: Evaluating Large Language Models for Verilog Code Generation, arXiv 2309.07544 (v2, 10 Dec 2023) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.