Déploiement réelAutomatisation cognitive2024-10-31
L'AI Red Team de Microsoft indique qu'elle a mené plus de 80 opérations sur plus de 100 produits d'IA générative, et que l'automatisation ne devrait pas servir à sortir l'humain de la boucle
Testeur logiciel / ingénieur qualitépage du métier →Date de l'événement / signalement
2024-10-31 · signalé 2025-01-13
Stade de la preuve
Déploiement réelUn employeur l'a mis en production. Cela peut déplacer la ligne de base — pondéré par l'échelle et par la ressemblance du cadre avec le vôtre.
Tâches concernées
Tester des systèmes avec un modèle dedans
Évaluer un logiciel dont la sortie n'est pas déterministe — bâtir des jeux d'évaluation, attraper les régressions de comportement, tester les sorties nuisibles.
Nouvelle tâche✓ Appuyé sur des preuves
Où ceci s'applique
Un article de l'AI Red Team de Microsoft sur son propre travail de test des produits d'IA générative, à la recherche de défaillances de sûreté et de sécurité. Il indique qu'en octobre 2024 l'équipe avait mené plus de 80 opérations couvrant plus de 100 produits, que ce volume rendait impraticable un test entièrement manuel, si bien qu'elle a construit de l'automatisation, et que ces outils ne devraient pas être utilisés dans l'intention de sortir l'humain de la boucle, puisque hiérarchiser les risques, concevoir des attaques et définir de nouvelles catégories de préjudice exigent un jugement humain. Il s'agit d'une red team dédiée et non de la qualité produit, et Microsoft vend les modèles et promeut son outil open source.
Ce que cela veut dire
Dans une grande entreprise, tester un logiciel qui contient un modèle est devenu une activité à part entière, menée par des spécialistes sur une centaine de produits, l'automatisation assurant le volume et les personnes le jugement. C'est un travail de test nouveau, et il reste aux personnes.
Ce que cela ne montre pas encore
L'équipe spécialisée d'une seule entreprise ; cela ne montre pas comment les équipes qualité produit testent les fonctions à base de modèles.
Ce que vous pouvez vérifier
Ouvrez arXiv:2501.07238 et cherchez « should not be used with the intention of taking the human out of the loop ».
Cela change-t-il l'évaluation ?
Non. L'indice d'impact n'est jamais déplacé par un seul événement. Ce que ce dossier a fait : 1 jugement de tâche lié ci-dessus repose désormais sur une preuve au lieu d'une inférence.
Source
Bullwinkel, Minnich et al. (Microsoft) — "Lessons From Red Teaming 100 Generative AI Products", arXiv:2501.07238 (13 January 2025) · vérifié 2026-09-27 · Claude (VOLO agent) · interprété 2026-09-27 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.