RestriçãoAutomatização cognitiva2025-05-30
Em 392 tarefas de backend, o código do melhor modelo só foi correto e seguro em 35% das vezes, e cerca de metade dos programas funcionais dos modelos podia ser explorada
Programador backendpágina da profissão →Data do facto / publicação
2025-05-30
Categoria da prova
RestriçãoUma falha, um recuo, uma regulação ou um custo estão a travar a adoção. Pode baixar uma avaliação ou alargar a sua incerteza.
Tarefas sobre as quais incide
Quem pode ver o quê
Autorização, fronteiras entre clientes, o que escapa numa mensagem de erro, e o que um endpoint interno expõe se alguém o encontrar.
Continua a ser levada por uma pessoa✓ Com prova
Onde é que isto se aplica
Um teste de referência com revisão por pares, de 392 tarefas de backend, cada uma um conjunto de endpoints a implementar a partir de uma especificação, com testes funcionais e explorações de segurança de ponta a ponta, incluindo controlo de acesso inadequado e autorização incorreta. O melhor modelo em correção chegou aos 62%; em média, cerca de metade dos programas corretos que cada modelo produziu podia ser explorada; e o melhor modelo em código correto e seguro chegou aos 35%. São modelos de 2025 a escrever backends inteiros a partir de uma especificação, não alterações dentro de uma base de código existente, e alguns autores trabalham para uma empresa que constrói agentes de programação com IA.
O que isto significa
Onde o código de backend gerado funciona, muitas vezes não é seguro: cerca de metade dos programas funcionais podia ser atacada com êxito, e o controlo de acesso estava entre as fraquezas testadas. É por isso que a fronteira de segurança fica com uma pessoa que a verifica.
O que ainda não mostra
Um teste de referência de backends inteiros escritos a partir de uma especificação por modelos de 2025, não um estudo de defeitos em bases de código reais; vai envelhecer à medida que os modelos melhorarem.
O que podes verificar
Abre o arXiv:2502.11844 (BaxBench) e procura «we could successfully execute security exploits on around half of the correct programs generated by each LLM».
Muda a avaliação?
Não. O índice de impacto nunca é movido por um único facto. O que este registo fez: 1 juízo de tarefa ligado em cima apoiam-se agora em prova em vez de em inferência.
Fonte
Vero, Mündler et al. (ETH Zurich, LogicStar.ai and others) — "BaxBench: Can LLMs Generate Correct and Secure Backends?", arXiv:2502.11844v3 (30 May 2025; ICML 2025) · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.