La question
Ce qui s'automatise vraiment, et comment le repérer
Pas la difficulté de la tâche. Pas sa rémunération. La propriété qui prédit si une tâche a bougé, c'est de savoir si autre chose qu'un être humain peut dire « c'est faux, recommence » — et le dire mille fois dans la nuit sans se fatiguer.
Deux entreprises, deux couches de la pile, la même machinerie
Airbnb a publié le récit de la migration de près de 3 500 fichiers de tests de composants React d'un cadre de test à un autre : six semaines contre une estimation manuelle d'un an et demi, avec 75 % des fichiers traités dès la première passe groupée de quatre heures. Amazon a publié avoir fait passer des dizaines de milliers de ses propres applications Java en production vers une version plus récente de Java, estimant l'équivalent manuel à plus de 4 500 années de travail de développement.
Ni l'un ni l'autre ne concerne l'écriture de logiciels neufs. Les deux concernent la modification de logiciels qui existent déjà et doivent continuer à fonctionner. Et les deux ont marché pour une raison que chaque entreprise énonce clairement : chaque étape du travail a un arbitre automatique. Le compilateur rejette ce qui ne se construira pas ; la suite de tests attrape l'essentiel de ce qui se construit mais reste faux ; l'analyseur de style et le vérificateur de types attrapent le reste. Airbnb a modélisé sa migration comme une machine à états où un fichier n'avance que si le contrôle précédent passe, puis s'est contenté de réessayer — la plupart des fichiers ont abouti en moins de dix tentatives.
C'est là tout le tour de main, et il vaut la peine de le dire simplement : le modèle n'était pas meilleur qu'une personne à cet exercice. Il a eu le droit de se tromper, à bas coût, des milliers de fois, sans personne pour regarder. Un ingénieur humain ne peut pas se tromper cent fois sur un même fichier. Une boucle, si.
- Airbnb rapporte avoir migré près de 3 500 fichiers de tests de composants React d'Enzyme vers React Testing Library en six semaines, contre une estimation à la main de 1.5 année
- Amazon dit avoir fait passer des dizaines de milliers de ses propres applications Java de production de Java 8 ou 11 à Java 17 avec un agent, et estime l'équivalent manuel à plus de 4 500 années de travail de développement
Airbnb a aussi publié le plafond, et c'est la chose la plus rare
Trois pour cent des fichiers ne sont pas passés. Chacun d'eux avait été réessayé entre cinquante et cent fois avant que l'équipe s'arrête et les termine à la main. Ce chiffre est plus utile que les 97 % au-dessus de lui, parce qu'il mesure la part que l'automatisation n'a pas pu atteindre alors même que réessayer était presque gratuit.
Notez aussi ce qui, selon l'équipe, a fait la différence sur les fichiers difficiles : non une meilleure formulation des consignes, mais le choix des fichiers liés à placer sous les yeux du modèle — jusqu'à cinquante d'entre eux, des consignes atteignant cent mille jetons. L'intrant rare était de savoir quelles parties du dépôt étaient pertinentes. C'est un jugement sur le code d'une entreprise précise, et il a été porté par les personnes qui y travaillent.
Le cas inverse : retirez l'arbitre et le sens s'inverse
Un essai contrôlé randomisé mené par METR a confié à seize mainteneurs open source expérimentés 246 tickets réels dans des dépôts qu'ils connaissaient bien. Avec des outils de l'ère 2025, ils ont été 19 % plus lents. Ils croyaient avoir été 20 % plus rapides. La même technologie, appliquée à un travail où la bonne réponse n'est pas vérifiable mécaniquement et où le développeur détient déjà le contexte, a déplacé le chiffre dans l'autre sens — et a déplacé la perception des développeurs à l'opposé de la mesure.
Cette dernière partie explique pourquoi l'auto-déclaration ne constitue pas une preuve sur ce site. Les personnes de l'essai étaient expérimentées, motivées, et se trompaient sur leur propre vitesse d'environ quarante points de pourcentage.
Quatre référentiels disent la même chose depuis l'autre côté
Spider 2.0 pose des questions de données d'entreprise sur de vrais entrepôts — un millier de colonnes, plusieurs dialectes SQL, de la documentation et un dépôt de code à explorer. Un agent de code en a résolu 21.3 %, contre 91.2 % sur la version académique de la même tâche. Beaver, construit à partir de vrais journaux de requêtes d'entrepôts d'entreprise, donne zéro à un modèle de langage brut là où les référentiels publics affichent 80 à 90. Sur les 537 questions rédigées par des experts du Finance Agent Benchmark à partir de publications récentes, les meilleurs modèles restent très loin d'un analyste.
GDPval, d'OpenAI, qui rassemble de vrais livrables issus de 44 métiers et fait noter à l'aveugle les productions des modèles par des experts du secteur, rapporte le gradient directement : les taux de victoire sont les plus élevés sur les tâches de zéro à deux heures et baissent régulièrement à mesure que la tâche s'allonge. Plus une tâche dure, plus elle est faite de décisions que rien ne peut vérifier avant la fin.
Aucun de ces chiffres ne dit à quel point un modèle est intelligent. Ils disent où l'arbitre cesse de fonctionner. Quand la bonne réponse dépend de savoir quelle table de cette entreprise est la vraie, laquelle de deux fiches en double garder, ou ce que le client voulait réellement dire, rien d'autre qu'une personne ne peut le dire.
- Sur 632 flux de données d'entreprise tirés de vrais entrepôts, un agent de code en a résolu 21.3 % — contre 91.2 % sur la version académique de la même tâche
- Sur Beaver, un banc d'essai de langue naturelle vers SQL construit à partir de vrais journaux de requêtes d'entrepôts d'entreprise, un modèle de langue seul a obtenu zéro et un montage agentique a atteint environ 10 %, contre plus de 80 à 90 % sur les bancs d'essai publics
- Sur le Finance Agent Benchmark — 537 questions rédigées par des experts à partir de documents récents déposés auprès de la SEC — le meilleur modèle, o3 d'OpenAI, a atteint 46.8 % d'exactitude à 3.79 dollars la requête
- Le banc d'essai GDPval d'OpenAI a recueilli de vrais livrables d'acheteurs et fait noter à l'aveugle la production des modèles par des experts du secteur face à ces livrables
Ce qui se passe quand le travail part sans arbitre
Des tribunaux fédéraux américains ont sanctionné des avocats pour des écritures appuyées sur des citations d'affaires qui n'existent pas — une amende de 5 000 dollars dans un cas, une autorisation d'exercer retirée dans un autre. Une liste de lectures d'été diffusée en syndication a paru dans le Chicago Sun-Times et le Philadelphia Inquirer avec des livres qui n'ont jamais été écrits. Les sous-titres allemands de Crunchyroll pour une première d'anime contenaient la phrase « ChatGPT a dit… ». La Cour suprême de Floride a depuis modifié ses règles pour que signer une écriture constitue en soi une déclaration sur l'autorité juridique qui y est citée.
Ce ne sont pas des ratés amusants, c'est la même structure que les réussites. Là où l'étape de contrôle était mécanique, la machine l'a faite. Là où l'étape de contrôle était une personne, et où cette personne a été retirée pour économiser l'étape de contrôle, l'erreur a atteint le monde extérieur — et un tribunal, un rédacteur en chef ou un régulateur est alors devenu l'arbitre, après coup et à un coût bien plus élevé.
- Un tribunal fédéral américain a sanctionné deux avocats et leur cabinet de 5 000 dollars pour des écritures citant six affaires inexistantes produites par ChatGPT, en relevant qu'utiliser un outil d'IA fiable n'est pas en soi fautif
- Un tribunal fédéral du Wyoming a sanctionné financièrement trois avocats et révoqué l'admission pro hac vice de l'un d'eux après qu'une requête déposée par eux citait neuf décisions, dont huit n'existaient pas
- La Cour suprême de Floride a modifié la règle 2.515(d)(2) : signer un acte de procédure revient à affirmer que les autorités juridiques citées existent et sont exactes, sous peine de sanctions, à compter du 15 juin 2026
- Le Chicago Sun-Times et le Philadelphia Inquirer ont imprimé une liste de lectures d'été diffusée en syndication comportant des livres qui n'existent pas ; le pigiste a dit avoir utilisé un outil d'IA et la rubrique n'a pas été relue
- Les sous-titres allemands de Crunchyroll pour une première d'anime contenaient la phrase « ChatGPT a dit… » ; l'entreprise a déclaré qu'un prestataire externe avait utilisé des sous-titres produits par IA en violation de son contrat
Quoi en faire lundi matin
Prenez votre propre liste de travaux en attente et marquez chaque élément avec ce qui vous dirait qu'il est terminé : une coche verte qui apparaît sans vous, ou une personne qui le regarde. La première liste est celle qui est en train de devenir moins chère, quel que soit votre secteur. Savoir quelle est la longueur de cette liste à l'intérieur de votre propre métier vaut plus que n'importe quel pourcentage publié, et personne d'autre ne peut le calculer pour vous.
Regardez ensuite la seconde liste et posez une question plus dure : le contrôle que vous exercez est-il visible pour la personne qui décide de votre budget ? Le motif récurrent dans ces enregistrements, c'est que l'étape de relecture est la première coupée, parce qu'elle ne produit aucun livrable — et son absence ne se voit pas avant deux trimestres.
Ce que ceci n'établit pas
La propriété de l'arbitre automatique explique quelles tâches ont bougé dans les cas que nous détenons ; ce n'est pas une loi et cela ne prédit rien. Deux des enregistrements les plus solides ici sont des entreprises publiant sur leur propre ingénierie avec leurs propres estimations contrefactuelles, que personne d'extérieur n'a vérifiées. Rien de tout cela n'établit que quiconque a perdu un emploi — aucun de ces déploiements ne fait état d'un changement d'effectif, et nous non plus. Et qu'une tâche n'ait pas d'arbitre automatique aujourd'hui n'est pas une sécurité : cela veut dire que l'outillage actuel n'a pas de moyen peu coûteux d'itérer dessus, ce qui est une affirmation sur l'outillage.
Tout ce qui est cité ici
Chacune ouvre le dossier complet : sa source et son rang de source, les dates, le périmètre auquel elle s'applique, qui l'a vérifiée et ce qu'elle n'établit pas.
- Airbnb rapporte avoir migré près de 3 500 fichiers de tests de composants React d'Enzyme vers React Testing Library en six semaines, contre une estimation à la main de 1.5 année — The Airbnb Tech Blog (Airbnb's own engineering blog)
- Amazon dit avoir fait passer des dizaines de milliers de ses propres applications Java de production de Java 8 ou 11 à Java 17 avec un agent, et estime l'équivalent manuel à plus de 4 500 années de travail de développement — AWS DevOps & Developer Productivity Blog (Amazon's own)
- Un essai randomisé de METR portant sur 16 développeurs open source expérimentés et 246 tickets réels a trouvé qu'ils mettaient 19 % de temps en plus avec les outils d'IA du début 2025, tout en croyant avoir été 20 % plus rapides — METR — study report
- Sur 632 flux de données d'entreprise tirés de vrais entrepôts, un agent de code en a résolu 21.3 % — contre 91.2 % sur la version académique de la même tâche — Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows (arXiv:2411.07763)
- Sur Beaver, un banc d'essai de langue naturelle vers SQL construit à partir de vrais journaux de requêtes d'entrepôts d'entreprise, un modèle de langue seul a obtenu zéro et un montage agentique a atteint environ 10 %, contre plus de 80 à 90 % sur les bancs d'essai publics — BLOG@CACM (Stonebraker & Chen, MIT)
- Sur le Finance Agent Benchmark — 537 questions rédigées par des experts à partir de documents récents déposés auprès de la SEC — le meilleur modèle, o3 d'OpenAI, a atteint 46.8 % d'exactitude à 3.79 dollars la requête — arXiv 2508.00828 (Bigeard, Nashold, Krishnan, Wu)
- Le banc d'essai GDPval d'OpenAI a recueilli de vrais livrables d'acheteurs et fait noter à l'aveugle la production des modèles par des experts du secteur face à ces livrables — GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks (OpenAI, arXiv:2510.04374)
- Un tribunal fédéral américain a sanctionné deux avocats et leur cabinet de 5 000 dollars pour des écritures citant six affaires inexistantes produites par ChatGPT, en relevant qu'utiliser un outil d'IA fiable n'est pas en soi fautif — Mata v. Avianca, Inc. (S.D.N.Y., 22 June 2023) — opinion and order on sanctions, via CourtListener
- Un tribunal fédéral du Wyoming a sanctionné financièrement trois avocats et révoqué l'admission pro hac vice de l'un d'eux après qu'une requête déposée par eux citait neuf décisions, dont huit n'existaient pas — US District Court, D. Wyo. — Wadsworth v. Walmart, 2:23-cv-118-KHR, ECF No. 181 (order of Judge Kelly H. Rankin)
- La Cour suprême de Floride a modifié la règle 2.515(d)(2) : signer un acte de procédure revient à affirmer que les autorités juridiques citées existent et sont exactes, sous peine de sanctions, à compter du 15 juin 2026 — Supreme Court of Florida, No. SC2026-0673 — In re: Amendments to Florida Rule of General Practice and Judicial Administration 2.515 (2026-05-28)
- Le Chicago Sun-Times et le Philadelphia Inquirer ont imprimé une liste de lectures d'été diffusée en syndication comportant des livres qui n'existent pas ; le pigiste a dit avoir utilisé un outil d'IA et la rubrique n'a pas été relue — NBC News
- Les sous-titres allemands de Crunchyroll pour une première d'anime contenaient la phrase « ChatGPT a dit… » ; l'entreprise a déclaré qu'un prestataire externe avait utilisé des sous-titres produits par IA en violation de son contrat — Engadget
- Faire que les gens s'en servent vraiment — tâche de Responsable du déploiement de l'IA
- Faire que les chiffres veuillent dire quelque chose — tâche de Responsable des systèmes de gestion