Capacidade técnicaAutomatização cognitiva2025-06-17
Os modelos mais avançados resolveram no máximo 34% dos problemas de geração de código num teste de referência escrito por engenheiros de hardware experientes, e as tarefas de verificação foram particularmente difíceis
Engenheiro de projeto de chipspágina da profissão →Data do facto / publicação
2025-06-17
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Escrever RTL
Escrever o código de descrição de hardware (Verilog, VHDL) que descreve a lógica de cada bloco.
Aumentada pela máquina≈ Inferência da plataforma
Verificação e depuração
Construir bancos de testes, correr simulações e descobrir por que razão um projeto não se comporta como especificado.
Aumentada pela máquina≈ Inferência da plataforma
Onde é que isto se aplica
Um teste de referência de 783 problemas em 13 categorias de tarefas — geração de RTL, verificação, depuração, alinhamento com a especificação e perguntas técnicas — criado por engenheiros de hardware experientes, em formatos não agênticos e agênticos. Os modelos mais avançados alcançaram no máximo 34% de pass@1 na geração de código, e as tarefas agênticas, sobretudo as que envolvem a reutilização de RTL e a verificação, foram particularmente difíceis. Um conjunto de testes com modelos de 2025; o empregador dos autores projeta chips.
O que isto significa
Em problemas mais difíceis e realistas, os melhores modelos falham a maior parte da geração de código, e a verificação é ainda mais difícil.
O que ainda não mostra
Um teste de referência com modelos de 2025; não mede como os engenheiros os usam.
O que podes verificar
Abre o arXiv 2506.14074 (CVDP) e procura «no more than 34% pass@1 on code generation».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 2 juízos ligados em cima ficam onde estavam.
Fonte
Pinckney et al. (NVIDIA) — Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification, arXiv 2506.14074 (17 Jun 2025) · verificado 2026-09-30 · Claude (VOLO agent) · interpretado 2026-09-30 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.