ContrainteAutomatisation cognitive2025-05-30
Sur 392 tâches côté serveur, le code du meilleur modèle n'était correct et sûr que dans 35 % des cas, et environ la moitié des programmes fonctionnels des modèles pouvaient être exploités
Développeur côté serveurpage du métier →Date de l'événement / signalement
2025-05-30
Stade de la preuve
ContrainteUn échec, un retour en arrière, une réglementation ou un coût freine l'adoption. Cela peut abaisser une appréciation ou élargir son incertitude.
Tâches concernées
Qui a le droit de voir quoi
Autorisation, frontières entre clients, ce qui fuit dans un message d'erreur, et ce qu'un point d'entrée interne expose si quelqu'un le trouve.
Encore menée par des humains✓ Appuyé sur des preuves
Où ceci s'applique
Un banc d'essai évalué par les pairs, composé de 392 tâches côté serveur, chacune étant un ensemble de points d'entrée à implémenter à partir d'une spécification, avec des tests fonctionnels et des exploits de sécurité de bout en bout, notamment sur un contrôle d'accès inadéquat et une autorisation incorrecte. Le meilleur modèle en justesse a atteint 62 % ; en moyenne, environ la moitié des programmes corrects produits par chaque modèle pouvaient être exploités ; et le meilleur modèle en code à la fois correct et sûr a atteint 35 %. Il s'agit de modèles de 2025 écrivant des back-ends entiers à partir d'une spécification, non de modifications au sein d'une base de code existante, et certains auteurs travaillent pour une entreprise qui construit des agents d'IA de programmation.
Ce que cela veut dire
Là où le code côté serveur généré fonctionne, il n'est souvent pas sûr : environ la moitié des programmes fonctionnels pouvaient être forcés, et le contrôle d'accès figurait parmi les faiblesses testées. C'est pourquoi la frontière de sécurité reste à une personne qui la vérifie.
Ce que cela ne montre pas encore
Un banc d'essai de back-ends entiers écrits à partir d'une spécification par des modèles de 2025, non une étude de défauts sur de vraies bases de code ; il vieillira à mesure que les modèles progressent.
Ce que vous pouvez vérifier
Ouvrez arXiv:2502.11844 (BaxBench) et cherchez « we could successfully execute security exploits on around half of the correct programs generated by each LLM ».
Cela change-t-il l'évaluation ?
Non. L'indice d'impact n'est jamais déplacé par un seul événement. Ce que ce dossier a fait : 1 jugement de tâche lié ci-dessus repose désormais sur une preuve au lieu d'une inférence.
Source
Vero, Mündler et al. (ETH Zurich, LogicStar.ai and others) — "BaxBench: Can LLMs Generate Correct and Secure Backends?", arXiv:2502.11844v3 (30 May 2025; ICML 2025) · vérifié 2026-09-27 · Claude (VOLO agent) · interprété 2026-09-27 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.