Capacidade técnicaAutomatização cognitiva2024-08-23
Modelos de IA multimodais tiveram dificuldade em localizar as regras relevantes, reconhecer componentes em imagens de CAD e analisar desenhos técnicos no DesignQA, um teste de referência construído sobre as regras da Formula SAE
Engenheiro mecânicopágina da profissão →Data do facto / publicação
2024-08-23
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Protótipos, ensaios e investigação de avarias
Construir e ensaiar protótipos, e investigar por que razão os equipamentos avariam em serviço.
Continua a ser levada por uma pessoa≈ Inferência da plataforma
Onde é que isto se aplica
Um teste de referência construído sobre o regulamento da competição universitária Formula SAE, com imagens de CAD e desenhos técnicos da equipa MIT Motorsports. Relata que os modelos testados, embora promissores, têm dificuldade em localizar com fiabilidade as regras relevantes, enfrentam dificuldades em reconhecer componentes técnicos em imagens de CAD e têm dificuldade em analisar desenhos técnicos; mesmo com o regulamento completo, o GPT-4o não conseguiu extrair com fiabilidade regras específicas. Testa modelos de 2024 sobre as regras de uma competição, e vários autores trabalham para uma empresa de software de projeto.
O que isto significa
Ler desenhos e regras — a base da revisão de projeto e da investigação de avarias — é onde estes modelos são mais fracos. O engenheiro que lê o desenho à luz do requisito não é a parte que está a ser automatizada.
O que ainda não mostra
Modelos de 2024 sobre os documentos de uma competição; não mede o trabalho de ensaio nem de investigação de avarias.
O que podes verificar
Abre o arXiv 2404.07917 (DesignQA) e procura «encounter difficulty in analyzing engineering drawings».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 1 juízo ligado em cima ficam onde estavam.
Fonte
Doris et al. (MIT, Autodesk Research) — DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation, arXiv 2404.07917 (v2, 23 Aug 2024) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.