Implementação realAutomatização cognitiva2024-10-31
A equipa AI Red Team da Microsoft diz ter realizado mais de 80 operações sobre mais de 100 produtos de IA generativa, e que a automatização não deve ser usada para tirar a pessoa do circuito
Testador de software / engenheiro de QApágina da profissão →Data do facto / publicação
2024-10-31 · publicado 2025-01-13
Categoria da prova
Implementação realUma empresa pô-lo em produção. Pode mover a linha de base, ponderado pela escala e por quanto esse contexto se parece com o teu.
Tarefas sobre as quais incide
Testar sistemas com um modelo lá dentro
Avaliar software cujo resultado não é determinístico — construir conjuntos de avaliação, apanhar regressões de comportamento, testar saídas nocivas.
Tarefa nova✓ Com prova
Onde é que isto se aplica
Um artigo da equipa AI Red Team da Microsoft sobre o seu próprio trabalho a testar produtos de IA generativa quanto a falhas de segurança e de cibersegurança. Diz que, em outubro de 2024, a equipa tinha conduzido mais de 80 operações que cobriam mais de 100 produtos, que o volume tornava impraticáveis os testes totalmente manuais e que por isso construiu automatização, e que essas ferramentas não devem ser usadas com a intenção de tirar a pessoa do circuito, porque dar prioridade aos riscos, desenhar ataques e definir novas categorias de dano exigem critério humano. Trata-se de uma red team dedicada, e não da QA de produto, e a Microsoft vende os modelos e promove a sua ferramenta de código aberto.
O que isto significa
Testar software com um modelo lá dentro tornou-se uma operação à parte numa grande empresa, conduzida por especialistas em cem produtos, com a automatização a tratar do volume e as pessoas do critério. É trabalho de testes novo, e fica com pessoas.
O que ainda não mostra
A equipa especializada de uma só empresa; não mostra como as equipas de QA de produto testam funcionalidades baseadas em modelos.
O que podes verificar
Abre o arXiv:2501.07238 e procura «should not be used with the intention of taking the human out of the loop».
Muda a avaliação?
Não. O índice de impacto nunca é movido por um único facto. O que este registo fez: 1 juízo de tarefa ligado em cima apoiam-se agora em prova em vez de em inferência.
Fonte
Bullwinkel, Minnich et al. (Microsoft) — "Lessons From Red Teaming 100 Generative AI Products", arXiv:2501.07238 (13 January 2025) · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.