Capacité techniqueAutomatisation cognitive2025-10-05
Le banc d'essai GDPval d'OpenAI a recueilli de vrais livrables d'acheteurs et fait noter à l'aveugle la production des modèles par des experts du secteur face à ces livrables
Acheteur / spécialiste de la chaîne d'approvisionnementpage du métier →Date de l'événement / signalement
2025-10-05
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Trouver et comparer les fournisseurs
Qui peut fabriquer cela, à quel prix, selon quel cahier des charges, pour quand.
En cours d'automatisation≈ Estimation de la plateforme
La commande et la paperasse
Passer la commande, la rapprocher de la facture et du bon de réception, relancer sur l'écart.
En cours d'automatisation≈ Estimation de la plateforme
Où ceci s'applique
Les acheteurs et agents d'approvisionnement sont l'un des 44 métiers américains du banc d'essai, répartis sur les neuf secteurs qui contribuent le plus au PIB américain ; 1 320 tâches dans l'ensemble complet, avec au moins 30 par métier, chacune bâtie sur un vrai livrable produit par un professionnel comptant en moyenne 14 ans d'expérience et couvrant la majorité des activités O*NET de ce métier. Ce qui est noté est un livrable, en un seul coup, par comparaison appariée à l'aveugle par des experts — non un métier. Il n'y a ni client, ni tour de révision, ni négociation, ni conséquence en cas d'erreur. Le chiffre affiché (47.6 % des livrables du sous-ensemble de référence d'un modèle jugés meilleurs ou aussi bons que celui de l'expert) porte sur la génération de modèles de septembre 2025 et a été dépassé ; plus utilement, l'article rapporte que les taux de victoire sont les plus élevés sur les tâches de 0 à 2 heures et déclinent régulièrement à mesure que la tâche s'allonge. Les taux par métier ne sont publiés que sous forme de figure : aucun chiffre propre aux achats n'est donc cité ici. OpenAI a conçu le banc d'essai, l'a exécuté, et vend des modèles qu'il mesure.
Ce que cela veut dire
Quelqu'un a désormais écrit ce que ce métier produit, en public, sous une forme que n'importe qui peut opposer à un modèle — une trentaine de vrais livrables d'achat, venus d'un praticien avec plus d'une décennie derrière lui. C'est la première fois que ce métier apparaît dans le domaine public autrement que comme un marché cible pour un logiciel. Cela mérite d'être lu pour la description plus que pour la note : le banc d'essai est une liste de ce dont la moitié documentaire de ce métier consiste réellement.
Ce que cela ne montre pas encore
Cela ne montre pas un modèle faisant votre métier, et les auteurs du banc d'essai ne le prétendent pas. Une tâche GDPval arrive entièrement spécifiée, ses fichiers de référence joints, et est notée une fois. Les parties de ce métier qui ne sont pas un livrable — savoir qu'un fournisseur va défaillir, décider qui sera servi en dernier, être la personne qu'un directeur d'usine appelle à minuit — n'y sont pas et n'étaient pas censées y être. Cela ne dit pas non plus qu'un employeur a changé quoi que ce soit : c'est une mesure de capacité, et la capacité n'est pas l'adoption.
Ce que vous pouvez vérifier
Prenez le travail du mois dernier et faites deux piles : ce qui a fini en document lu par quelqu'un d'autre, et ce qui a fini en décision ou en appel téléphonique. GDPval teste seulement la première pile. Le rapport entre vos deux piles est ce qu'il faut savoir, et personne d'autre ne peut le calculer pour vous.
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 2 jugements liés ci-dessus restes là où il était.
Source
GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (OpenAI, arXiv:2510.04374) · vérifié 2026-09-12 · Claude (VOLO agent) — PDF downloaded from arXiv and read; the 44-occupation table, the 1,320/30-per-occupation counts, the 14-year figure, the 47.6% headline and the task-duration gradient each located in the paper's own text · interprété 2026-09-12 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.
Ce dossier est cité dans