Capacidade técnicaAutomatização cognitiva2025-04-08
Chamadas executáveis a uma ferramenta de simulação comercial foram produzidas por modelos de IA 88% das vezes no FEABench, mas quase nunca um resultado a menos de 10% da resposta correta
Engenheiro mecânicopágina da profissão →Data do facto / publicação
2025-04-08
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Simulação e análise
Preparar simulações de elementos finitos, térmicas e de fluidos, e avaliar se os resultados são credíveis.
Aumentada pela máquina≈ Inferência da plataforma
Onde é que isto se aplica
Um teste de referência de problemas de engenharia que os modelos resolvem comandando o COMSOL Multiphysics, uma ferramenta comercial de elementos finitos, através da sua API. A melhor estratégia gerou chamadas executáveis à API 88% das vezes; mas o artigo diz que o modelo passou o critério estrito — um valor-alvo válido a menos de 10% da resposta correta — num único problema em duas das suas experiências, e nos problemas de referência o Claude 3.5 Sonnet produziu um valor-alvo válido em 1 de 15. É um teste de referência pequeno, em pré-publicação, com modelos de 2024–2025, e o empregador dos autores desenvolve um dos modelos testados.
O que isto significa
Os modelos conseguem operar software de simulação; raramente tiram dele o número certo. O critério do engenheiro sobre se um resultado é credível é precisamente a parte que este teste de referência mostra em falta.
O que ainda não mostra
Um teste de referência pequeno, em pré-publicação; não mede o trabalho de simulação em produtos reais.
O que podes verificar
Abre o arXiv 2504.06260 (FEABench) e procura «generates executable API calls 88% of the time».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 1 juízo ligado em cima ficam onde estavam.
Fonte
Mudur et al. (Google Research, Harvard) — FEABench: Evaluating Language Models on Multiphysics Reasoning Ability, arXiv 2504.06260 (submitted 8 Apr 2025) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.
Este registo é citado em