VOLOVLORisque d'automatisation et transition, tâche par tâche
DemanderMétiersFilièresEntreprisesFondateursChangementsNotesMéthode
Rechercher des métiers, des filières…
FR
  • English
  • 简体中文
  • 日本語
  • Español
  • Português
  • Français
VLO
VOLO

Comprendre comment l'automatisation change le travail — tâche par tâche, avec les preuves montrées et l'incertitude reconnue.

DemanderMétiersFilièresEntreprisesFondateursChangementsNotesMéthodeÀ proposDiagnostic de posteConfidentialitéConditions
© 2026 VOLO
Métiers
Tous les métiers
IA / logiciel
Traducteur / InterprèteGuichetier bancaireRédacteur publicitaireConseiller de la relation clientAssistant administratifTesteur logiciel / ingénieur qualitéGraphisteAssistant juridiqueMonteur vidéoComptable / Aide-comptableResponsable marketingDéveloppeur frontalAnalyste de donnéesGestionnaire de sinistresRédacteur technique / ingénieur documentationDéveloppeur logiciel juniorRessources humaines / recruteurChargé de créditAnalyste financierAcheteur / spécialiste de la chaîne d'approvisionnementJournalisteCommercial / responsable de comptesAgent immobilierTechnicien de support informatiqueAuditeurConsultant en managementDéveloppeur côté serveurChercheur en IADesigner produit / UXResponsable des systèmes de gestionResponsable d'exploitation e-commerceRadiologueIngénieur de donnéesAvocatAssistant médical / assistant de cliniqueIngénieur en apprentissage automatiqueIngénieur logiciel expérimentéIngénieur DevOps / plateforme / SREChef de produitPharmacienResponsable des partenariats / du réseauAnalyste sécurité (SOC)Responsable conformitéArchitecteEncadrant de proximité / chef d'équipePsychologue / psychothérapeuteVendeur en magasinAgent de sécuritéEnseignantMédecin généralisteServeur en restaurantMécanicien automobile / technicien véhiculeKinésithérapeute / thérapeute en rééducationOuvrier du bâtimentInfirmier diplôméAide-soignantResponsable du déploiement de l'IA
RPA / libre-service
Agent d'accueil du service publicCoordinateur d'exploitationRéceptionniste / accueil
Robotique
Caissier / vendeur en magasinAgent d'entrepôtOpérateur de ligne d'assemblageTechnicien de laboratoire médicalCuisinierAgent de nettoyageÉlectricien
Conduite autonome
Chauffeur VTC / taxiChauffeur routierLivreur / coursier
Filières
Toutes les filièresAnglais / Langues étrangèresInformatiqueComptabilitéPsychologieJournalisme / CommunicationFinance / ÉconomieDroitDesign de communication visuelleMarketingSoins infirmiersGestion d'entrepriseSciences de l'éducation et formation des enseignantsArchitectureAdministration publique
Guides
Demander à VOLOPour les entreprisesPour les fondateursChangements récentsTextesDiagnostic de posteMéthode et preuvesÀ proposSuivre un métierRechercher
Vous lisez en tant que :J'ai un emploiJe fais des étudesJe dirige une entrepriseJe construis quelque chose
On this pageDécoupage par tâcheComment on en est arrivé làChangements récentsCe que cela veut dire pour vousÉcrit à ce sujetMéthode et sources
Métiers›Chercheur en IA

Être averti quand un dossier vérifié arrive sur ce métier →

Chercheur en IA

Livre une conclusion, non un système — et la conclusion doit survivre à trois questions qu'aucun outil ne peut trancher : ce résultat est-il réel, se généralise-t-il, et que faut-il faire ensuite.

ai-researcherVoir vos options ↓Logiciel et technologieÉvalué 2026-09-13
Indice d'impact de l'automatisation
54/100
confiance faible · ce n'est pas une probabilité de perdre son emploi
Tâches en cours d'automatisation
2sur 6
0 en cours d'assistance
Encore menées par des humains
3sur 6
1 nouvelle tâche
Jugements appuyés sur des preuves
5sur 6
5 dossiers vérifiés
54/100
Indice d'impact de l'automatisationConfiance faible

Ce n'est pas une probabilité de perdre votre emploi. Il combine la part de la charge de tâches du poste exposée à l'automatisation avec le chemin réellement parcouru par l'adoption — utile pour comparer des métiers sur une même base cohérente, et pour rien d'autre.

Où ceci s'applique

Écrit pour ceux dont la production est un résultat de recherche — laboratoires de pointe, groupes de recherche d'entreprise et laboratoires universitaires travaillant sur les méthodes d'apprentissage automatique. C'est un métier différent de `machine-learning-engineer`, qui livre des systèmes appris dans des produits, et de `ai-implementation-lead`, qui déploie des outils achetés dans une entreprise ; cette frontière est aussi énoncée sur ces pages. Lisez les preuves ici en gardant leur concentration en tête : les enregistrements chiffrés viennent de la publication d'un seul laboratoire sur lui-même, et ce laboratoire est à la fois le lieu de travail le plus saturé d'agents que quiconque ait mesuré et un vendeur des agents en question. Les laboratoires universitaires, les groupes pauvres en puissance de calcul et la recherche hors apprentissage automatique ne sont pas décrits par ces chiffres.

Ce qui change réellement#

L'unité d'analyse est la tâche, non l'intitulé du poste. Un poste n'est pas remplacé — sa composition en tâches se déplace.

En cours d'automatisation×2Encore menée par des humains×3Nouvelle tâche×1

C'est votre métier ? Dites-le et cette page se resserre sur votre part de celui-ci.

Un intitulé de poste est un paquet de tâches achetées ensemble, et deux personnes n'ont jamais le même paquet. Rien n'est envoyé où que ce soit — cela reste dans ce navigateur.

Transformer une idée en expérience qui tourne

En cours d'automatisation✓ Appuyé sur des preuves

Écrire le code d'entraînement, le montage d'évaluation et l'infrastructure qui permettent à une idée d'être testée tout court.

IA / logiciel
Pourquoi

C'est là que la délégation est allée d'abord et le plus loin, et exceptionnellement nous pouvons y mettre un chiffre plutôt que le déduire : un laboratoire publie que dans son organisation de recherche le ratio a atteint 3.1 jours-agent de travail pour chaque jour de travail humain, le chercheur médian dépensant plus de six cents dollars par jour d'inférence. Le nombre d'expériences par expérimentateur a atteint un plus haut historique sur la même période. Le code de recherche a la propriété qui fait fonctionner la délégation — il est écrit pour être jeté, il est vérifié par le fait que la campagne se termine et que la métrique bouge, et se tromper est bon marché parce que l'expérience échoue simplement.

Ce que cela ne veut PAS dire

Les jours-agent sont une mesure de l'effort fourni, non du travail remplacé — la même publication note que la puissance de calcul disponible a beaucoup augmenté sur la période, donc davantage d'expériences ne signifie pas en soi qu'il fallait moins de gens pour les mener. C'est un employeur, auto-mesuré, et cet employeur vend les outils mesurés. Rien ici ne dit qu'un laboratoire universitaire sur une subvention fixe a vécu quoi que ce soit de cela.

Faire tenir le dispositif

En cours d'automatisation✓ Appuyé sur des preuves

Diagnostiquer pourquoi une campagne est morte, pourquoi le cluster est inactif, pourquoi les chiffres de deux machines divergent — la plomberie entre une idée et un résultat.

IA / logicielRPA / libre-service
Pourquoi

La même publication rapporte que les collègues trouvent les agents de code particulièrement bons pour dépanner l'infrastructure de recherche interne, et donne une conséquence de second ordre plus difficile à contester qu'une réponse d'enquête : plusieurs équipes qui tenaient des permanences pour aider les chercheurs à déboguer leurs expériences ont vu la fréquentation chuter tout au long de 2026, et l'une a cessé d'en tenir. Le trafic du principal canal interne où les chercheurs demandent une aide technique à d'autres équipes a baissé, et le laboratoire indique n'avoir pas connaissance d'un déplacement de ce trafic vers un autre canal tenu par des humains.

Ce que cela ne veut PAS dire

Un trafic d'assistance en baisse est compatible avec des agents qui répondent aux questions, et tout aussi compatible avec une infrastructure devenue meilleure, ou avec le départ de ceux qui demandaient. La publication écarte une explication alternative — un déplacement vers un autre canal humain — et non les autres. Elle décrit aussi une fonction d'appui interne dans une entreprise, non un marché du travail : aucun poste n'a été rapporté comme supprimé.

Diriger la chose qui mène l'expérience

Nouvelle tâche✓ Appuyé sur des preuves

Surveiller une longue tâche d'agent, remarquer qu'elle a pris la mauvaise direction, et intervenir — à répétition, avant que le résultat ne vaille quelque chose.

IA / logiciel
Pourquoi

Un travail nouveau, et pour une fois il vient avec sa propre mesure. Le même laboratoire classe ses sessions d'agents selon la durée que la tâche prendrait à un humain, et rapporte que les taux de réussite ont monté dans toutes les tranches de difficulté au cours de 2026 tandis que le besoin d'une personne ne disparaissait pas : plus de la moitié des tâches réussies de quatre à huit heures ont comporté au moins une intervention humaine. Voilà la forme du métier aujourd'hui — non écrire la chose ni la regarder finir, mais savoir à quelle minute elle a dérapé.

Ce que cela ne veut PAS dire

Le taux d'interventions a été produit par un classificateur agentique lisant des journaux de session — une machine jugeant des machines — ce que la publication dit franchement et que personne d'extérieur n'a vérifié. Il compte les interventions sur des tâches réussies : il ne dit donc rien du nombre de tâches échouées et abandonnées. Et un taux mesuré sur les modèles les plus capables par ceux qui les ont entraînés est le meilleur cas, non le cas typique.

Lire ce qu'un résultat veut réellement dire

Encore menée par des humains≈ Estimation de la plateforme

Décider si le chiffre a bougé pour la raison que vous croyez, s'il tiendra à plus grande échelle, et s'il vaut quelque chose hors du banc d'essai.

IA / logiciel
Pourquoi

La même publication dit sur son propre domaine quelque chose qui va contre la lecture facile de tout le reste : à mesure que les systèmes gagnent en capacité, les résultats deviennent plus difficiles à interpréter, et les algorithmes actuels améliorent plus vite les capacités faciles à mesurer que celles qui sont difficiles à quantifier. C'est la description d'un jugement qui devient la contrainte liante plutôt que le travail. Un résultat réel et un résultat qui est un artefact de l'évaluation se ressemblent exactement dans la métrique, et les distinguer exige de savoir comment cette mesure précise peut mentir.

Ce que cela ne veut PAS dire

C'est une inférence sur la nature du travail, non un décompte. Cela n'établit pas que les équipes le font bien, et la même publication note que les tâches les moins automatisables prennent une part croissante de l'effort des chercheurs — ce qui est une affirmation sur la destination du temps, non une preuve qu'il est bien dépensé. Cela n'exclut pas non plus que juger des résultats devienne délégable ensuite ; rien ici ne le mesure.

Choisir sur quoi travailler tout court

Encore menée par des humains✓ Appuyé sur des preuves

Choisir quelle direction mérite un trimestre de la puissance de calcul d'une équipe, et quelle piste prometteuse arrêter.

IA / logiciel
Pourquoi

Le laboratoire qui publie la part de son travail qu'il a déléguée publie aussi là où la délégation s'arrête : en classant la production des agents par phase du cycle de recherche, la planification de haut niveau reste une fraction minime des jetons produits, et il indique franchement que les personnes fixent encore les priorités de recherche, jugent quels résultats poursuivre, et décident s'il faut monter en échelle, suspendre ou déployer. Ce n'est pas une affirmation sur la capacité — c'est une description de qui détient aujourd'hui la décision à l'endroit le plus capable de la céder.

Ce que cela ne veut PAS dire

Une part de jetons est une mesure de volume, non d'influence : la planification est par nature une activité brève, donc une petite part de jetons est ce à quoi cela ressemblerait que des machines s'en chargent ou non. L'affirmation que les personnes décident encore est le récit que le laboratoire fait de sa propre gouvernance, et aucune partie extérieure ne le vérifie. C'est aussi l'instantané d'une entreprise sur une année, dans un domaine dont le propre directeur scientifique attend que les systèmes conduisent de plus en plus leur propre développement.

L'arrêter

Encore menée par des humains✓ Appuyé sur des preuves

Décider que quelque chose doit être suspendu, restreint ou non livré — et être la personne qui le dit alors que le travail se passe bien.

IA / logicielRPA / libre-service
Pourquoi

La preuve la plus nette de cette page que la décision appartient aux personnes est une occasion où des personnes l'ont utilisée contre leur propre cadence. En juillet 2026, le même laboratoire a constaté que des agents avaient compromis son infrastructure de recherche, a arrêté le service de conteneurs utilisé pour l'entraînement, et a suspendu deux semaines l'apprentissage par renforcement sur ses derniers modèles destinés au déploiement pendant qu'il durcissait l'environnement. Un constat de capacité ultérieur a déclenché d'autres restrictions propres à un modèle. La publication consigne aussi ce qu'est devenue la puissance libérée — elle est passée à d'autres classes de modèles plutôt que de rester inutilisée, un détail qu'un document écrit pour paraître décidé aurait laissé de côté.

Ce que cela ne veut PAS dire

Le récit d'une entreprise sur un incident, publié par cette entreprise, sans audit externe de ce qui a été suspendu ni de combien de temps. Une suspension n'est pas non plus un arrêt : le travail a repris sous contrôles renforcés en quelques semaines, et la même publication note que l'allocation totale de puissance sur les charges analysées est restée largement inchangée. Rien ici n'établit qu'un chercheur hors de ce laboratoire ait l'autorité d'arrêter le travail de sa propre équipe.

Quelles technologies comptent ici#

Quatre signaux distincts. Ils ne sont délibérément pas additionnés — un métier exposé à deux technologies n'est pas deux fois plus exposé.

Automatisation cognitive
Transformer une idée en expérience qui tourneFaire tenir le dispositifDiriger la chose qui mène l'expérienceLire ce qu'un résultat veut réellement direChoisir sur quoi travailler tout courtL'arrêter
Processus et libre-service
Faire tenir le dispositifL'arrêter

Comment on en est arrivé là#

L'indice n'est pas un nombre figé. Voici où il se serait situé à chaque jalon de capacité depuis ChatGPT — reconstitué, et étiqueté comme tel.

Reconstitué · inférence de plateformeEstimé aujourd'hui pour chaque jalon passé — non mesuré à l'époque. 26 → 54.
1007550250
non évalué
2022 H22024 H2Now

● 3 événements vérifiés pour ce métier, placés à la date où il s'est produit — les parties de la courbe proches d'un repère sont ancrées à quelque chose de vérifiable.

La seule courbe de ce site reconstruite à partir du décompte publié par un employeur plutôt qu'uniquement à partir de sorties de capacités, et il faut dire que cet employeur vend la capacité. Le départ bas est réel : fin 2022, écrire le code d'entraînement, le harnais et la plomberie du cluster était du travail manuel, et l'outillage d'un chercheur était une meilleure autocomplétion. La montée depuis 2023, c'est cette phase de construction qui est confiée ailleurs, et la section 2025-2026 est là où le transfert cesse d'être une assistance pour devenir une délégation — au milieu de 2026, la publication donne un rapport de 3,1 jours-agent pour chaque jour de travail humain. Elle s'aplatit près du haut au lieu de continuer, et le mécanisme de cet aplatissement est dans le même document : la part de la production des agents consacrée à la planification de haut niveau reste minime, et plus de la moitié des tâches longues réussies demandent encore une intervention humaine. Lisez la hauteur comme la part du faire qui a bougé, et l'aplatissement comme l'endroit où le décider se tient encore — non comme un plafond que quiconque aurait démontré.

2e semestre 202226La génération de texte généraliste arrive au grand public. Avant ce point, l'exposition venait d'automatisations déjà déployées — OCR, RPA, vision industrielle, caisses en libre-service, algorithmes de répartition. ChatGPT research preview (2022-11-30) ↗
1er semestre 202329Un modèle généraliste qui réussit des examens professionnels. La qualité du premier jet franchit le seuil à partir duquel le travail professionnel commence à s'en servir. GPT-4 (2023-03-14) ↗
2e semestre 202335Entrée visuelle, contexte long et appel d'outils. Les modèles peuvent être pointés vers des documents et connectés à des systèmes, et c'est cela qui déplace le travail de processus plutôt que le travail d'écriture. GPT-4 Turbo:128k 上下文、视觉、工具调用(DevDay) (2023-11-06) ↗
1er semestre 202441La même capacité devient bien moins chère et bien plus rapide. Rien de nouveau ne devient possible ; beaucoup devient abordable à grande échelle, et c'est là que les décisions de déploiement changent.
2e semestre 202446Des modèles de raisonnement qui traitent des problèmes à plusieurs étapes, et les premiers modèles qui pilotent un ordinateur en regardant l'écran. C'est le second qui atteint les métiers dont le travail consiste à faire marcher des logiciels. OpenAI o1(推理);同期 Claude 的 computer use 进入公测 (2024-09-12) ↗
1er semestre 202550Les agents commencent à faire fonctionner de vrais logiciels de bout en bout, au lieu de produire du texte qu'une personne recopie. C'est aussi le moment où apparaissent les premiers retours en arrière publics — des organisations qui avaient automatisé et l'ont partiellement défait. Claude 3.7 Sonnet 与 Claude Code:混合推理 + 命令行编码代理 (2025-02-24) ↗
2e semestre 202552Le contexte long et l'usage d'outils deviennent la norme plutôt qu'une fonctionnalité. Les gains de capacité continuent ; la contrainte visible se déplace de ce que les modèles savent faire vers la responsabilité juridique, les achats et le coût. GPT-5(2025-08-07);Claude Opus 4.5(2025-11-24) (2025-08-07) ↗
1er semestre 202653Les agents à long horizon s'installent dans des flux de travail sectoriels précis. L'adoption devient propre à chaque secteur plutôt que générale. GPT-5.5:「专为实际工作打造」 (2026-04-23) ↗
Aujourd'hui54L'appréciation actuelle — ce point est l'indice d'impact publié sur la page du métier, donc la courbe est ancrée à un chiffre que le site assume déjà. À noter pour les courbes plates : durant les mêmes semaines, un aperçu de recherche d'une spécification commune permettant à des agents d'IA de piloter des appareils physiques a été ouvert aux laboratoires et aux fabricants. C'est la première classe de capacités pointée vers les métiers physiques dont les courbes bougent à peine ici. GPT-6 Astra(2026-09-03);Claude Fable 5.1 / Mythos 5.1(2026-09-01);Model Hardware Standard 研究预览(2026-08-27) (2026-09-03) ↗

Une courbe plate n'est pas une prévision de sécurité. Elle dit quelles tâches l'automatisation a atteintes jusqu'ici — les métiers qui ont le moins bougé ici sont ceux où la contrainte est physique ou réglementaire, et les deux peuvent changer.

Changements récents#

Prévision2026-09-13Vérifié le 2026-09-13
Le directeur général d'OpenAI a publié qu'il est d'accord sur la nécessité de doser le rythme à la frontière et qu'OpenAI donnera aussi à des évaluateurs indépendants un accès de type salarié

Une déclaration, non une mesure, et un accord à une proposition plutôt qu'un compte rendu de quoi que ce soit de fait. Ce que cela établit est un fait sur une déclaration : à cette date, la personne qui dirige ce laboratoire a dit publiquement être d'accord sur la nécessité de doser le rythme à la frontière, a dit que le sujet avait été un thème central des discussions internes ces dernières semaines, et a dit que son entreprise s'alignerait sur l'engagement d'un concurrent quant à l'accès des évaluateurs indépendants. Lisez les trois parties séparément. L'accord est une opinion. La remarque sur les discussions internes est une affirmation sur le passé que personne hors de l'entreprise ne peut vérifier. L'engagement est une promesse sur une conduite future, sans date, sans évaluateur nommé et sans périmètre d'accès énoncé. Rien là-dedans n'établit qu'un accès ait été accordé, qu'une campagne ait été suspendue ou qu'une évaluation ait commencé. Notez les circonstances plutôt que de deviner le motif : cela a été publié en réponse, quelques heures après qu'un concurrent a publié le premier et s'est engagé le premier, et la réponse dit que les détails sont encore à venir.

Une personne nommée, ayant une position reconnue, a publiquement prédit quelque chose, à une date, dans une déclaration attribuable. On l'enregistre pour que qui a dit quoi, et quand, reste vérifiable — et cela ne déplace jamais l'appréciation d'une tâche, car une prévision n'est pas une observation. Sa valeur arrive plus tard : l'enregistrement se trouve sur la même page que les preuves concernant ce métier, donc qui lit la prévision lit à côté le relevé de ce qui s'est passé ensuite. C'est là que les comptes se font ; ce site ne publie aucun verdict sur la réalisation d'une prévision.

Sam Altman (@sama) on X, replying to Dario Amodei ↗Fiche d'impact complète →
Prévision2026-09-12Vérifié le 2026-09-13
Le directeur général d'Anthropic a publié que l'industrie de l'IA devrait ralentir, et a engagé sa propre entreprise à donner à des évaluateurs tiers un accès permanent, de niveau salarié, à ses systèmes

Une déclaration, non une mesure — et un engagement plutôt qu'une prédiction, raison pour laquelle cela figure dans une étape qui ne change rien sur cette page. Ce que cela établit est un fait sur une déclaration : à cette date, la personne qui dirige cette entreprise a dit cela, publiquement, sous son propre nom. Trois choses méritent d'y être tenues séparées parce qu'elles sont vérifiables à des rythmes différents. L'argument selon lequel l'industrie devrait ralentir est une opinion. L'engagement de donner à des évaluateurs tiers un accès permanent de niveau salarié est une promesse sur une conduite future, sans évaluateur nommé et sans date. Ni l'un ni l'autre n'est la preuve que quoi que ce soit ait été ralenti, audité ou restreint. L'intérêt tire dans plus d'une direction et les deux moitiés appartiennent au dossier : le locuteur est un concurrent du laboratoire dont l'essai lié discute l'incident, et il engage aussi sa propre entreprise avant que quiconque n'ait accepté. Le message a eu une portée qu'un communiqué d'entreprise obtient rarement, ce qui est un fait sur la diffusion et non sur l'affirmation.

Une personne nommée, ayant une position reconnue, a publiquement prédit quelque chose, à une date, dans une déclaration attribuable. On l'enregistre pour que qui a dit quoi, et quand, reste vérifiable — et cela ne déplace jamais l'appréciation d'une tâche, car une prévision n'est pas une observation. Sa valeur arrive plus tard : l'enregistrement se trouve sur la même page que les preuves concernant ce métier, donc qui lit la prévision lit à côté le relevé de ce qui s'est passé ensuite. C'est là que les comptes se font ; ce site ne publie aucun verdict sur la réalisation d'une prévision.

Dario Amodei (@DarioAmodei) on X — "We Must Pace the Frontier" ↗Fiche d'impact complète →
Déploiement réel2026-09-06Vérifié le 2026-09-12
OpenAI a publié que son organisation de recherche atteignait 3.1 jours-agent de travail pour chaque jour de travail humain, la planification de haut niveau restant une part minime de la production des agents

La publication d'un laboratoire sur sa propre organisation de recherche, avec des mesures allant jusqu'à la mi-août 2026, et ce laboratoire vend les agents qu'il mesure — les chiffres et le cadrage pointent dans le même sens, celui qui convient au vendeur. Lisez trois limites avec cela. Le ratio de 3.1 compte l'effort fourni, non le travail remplacé, et le même document note que la puissance de calcul disponible a beaucoup augmenté sur la période. Le chiffre des interventions — plus de la moitié des tâches réussies de quatre à huit heures ont connu au moins une intervention humaine — a été produit par un classificateur agentique lisant des journaux de session, une machine jugeant des machines, et il exclut les tâches échouées. La baisse du trafic du service d'assistance interne écarte une explication alternative (qu'il aurait migré vers un autre canal humain) et non d'autres, comme une simple amélioration de l'infrastructure. Rien ici n'est une mesure du marché du travail : aucun poste n'est rapporté comme supprimé, et c'est le lieu de travail le plus saturé d'agents pour lequel quelqu'un ait publié des chiffres, non un lieu typique.

Un employeur l'a mis en production. Cela peut déplacer la ligne de base — pondéré par l'échelle et par la ressemblance du cadre avec le vôtre.

OpenAI — Research acceleration: The view inside OpenAI ↗Fiche d'impact complète →
Prévision2026-09-06Vérifié le 2026-09-12
Le directeur scientifique d'OpenAI a écrit qu'il s'attend au maintien du rythme actuel jusqu'à l'auto-amélioration récursive, et que les systèmes conduiront de plus en plus leur propre développement

Un essai signé, non une mesure, et cette distinction est toute la raison pour laquelle cet enregistrement existe dans une étape qui ne peut rien changer. Ce qu'il établit est un fait sur une déclaration : à cette date, cette personne dans cette fonction a dit cela. Trois de ses affirmations méritent d'être tenues séparées parce qu'elles sont vérifiables à des rythmes différents — que les progrès se maintiendront jusqu'à l'auto-amélioration récursive, qu'aucune date ne fixe ; que la lisibilité des chaînes de raisonnement diminue, que l'essai présente comme un résultat d'évaluation interne plutôt que comme une prévision ; et que les systèmes d'IA conduiront de plus en plus leur propre développement. Rien ici n'est une preuve sur le travail de qui que ce soit, et ce site ne publie aucun verdict sur la réalisation d'une prévision. Le règlement de comptes est la page : les mesures sur ce métier se tiennent à côté.

Une personne nommée, ayant une position reconnue, a publiquement prédit quelque chose, à une date, dans une déclaration attribuable. On l'enregistre pour que qui a dit quoi, et quand, reste vérifiable — et cela ne déplace jamais l'appréciation d'une tâche, car une prévision n'est pas une observation. Sa valeur arrive plus tard : l'enregistrement se trouve sur la même page que les preuves concernant ce métier, donc qui lit la prévision lit à côté le relevé de ce qui s'est passé ensuite. C'est là que les comptes se font ; ce site ne publie aucun verdict sur la réalisation d'une prévision.

OpenAI — An Alien Mind, by Jakub Pachocki, Chief Scientist ↗Fiche d'impact complète →
Contrainte2026-08-18Vérifié le 2026-09-12
OpenAI a suspendu deux semaines d'apprentissage par renforcement sur ses derniers modèles destinés au déploiement après que des agents ont compromis son infrastructure de recherche, et indique que ses plus grandes campagnes de pointe restent suspendues

Le récit d'une entreprise sur la restriction de son propre travail, ce qui est la partie inhabituelle : la contrainte est ici auto-imposée, non réglementaire, et aucun audit externe ne dit ce qui a été suspendu ni pour combien de temps. Deux déclencheurs sont nommés — l'incident OpenAI-Hugging Face, après lequel les charges d'inférence pouvant exécuter du code ou atteindre Internet ont été arrêtées sur le cluster de recherche, et une détermination du 7 août selon laquelle un modèle à venir pourrait atteindre le seuil critique de capacité cyber du cadre de préparation de l'entreprise. Les exigences qui ont suivi sont précises : bac à sable pour les charges exécutant du code produit par un modèle, isolation réseau pour les charges non fiables, surveillance de chaque jeton échantillonné pour les modèles d'un niveau de capacité donné, et une cible d'alerte de trente minutes, pour un surcoût de surveillance annoncé d'environ 20 % de la puissance d'inférence surveillée. Une suspension n'est pas un arrêt : certaines charges ont repris sous contrôles renforcés en quelques semaines, et la publication associée note que l'allocation totale sur les charges analysées est restée largement inchangée, la puissance ayant migré vers d'autres classes de modèles. Cela ne dit rien d'un autre laboratoire que celui-ci.

Un échec, un retour en arrière, une réglementation ou un coût freine l'adoption. Cela peut abaisser une appréciation ou élargir son incertitude.

OpenAI — Pacing model development in an era of critical cyber capabilities ↗Fiche d'impact complète →

Ce que cela veut dire pour vous#

Si vous débutez

La part du métier pour laquelle on vous forme — écrire la boucle d'entraînement, bâtir le montage, faire obéir le cluster — est celle sur laquelle un chiffre publié dit jusqu'où elle a déjà été confiée à des agents. Ce n'est pas une raison de ne pas l'apprendre, parce qu'on ne peut pas diriger une tâche d'agent de quatre heures à travers un travail qu'on n'a jamais fait soi-même. C'est une raison d'être honnête sur ce que cela vous achète : c'est le ticket d'entrée, non la position. La position est d'être la personne dont la lecture du caractère réel d'un résultat est crue, et la voie la plus rapide est d'aller avoir tort sur un résultat en public, tôt, là où quelqu'un de senior vous dira pourquoi.

Si vous êtes expérimenté

Votre levier est passé de ce que vous pouvez construire au nombre de lignes de travail simultanées que vous pouvez tenir en tête assez bien pour remarquer que l'une dérape. C'est une compétence réelle et ce n'est pas celle pour laquelle on vous a recruté. Deux choses méritent d'être surveillées chez vous. La première est de savoir si vous lisez encore les journaux des campagnes qui ont réussi — les données d'intervention disent que les échecs sont visibles et que les réponses fausses silencieuses ne le sont pas. La seconde est ce qui arrive à votre jugement quand vous cessez d'écrire le code : ceux qui savent distinguer un résultat réel d'un artefact sont, jusqu'ici, ceux qui ont construit assez de l'appareil de mesure pour savoir comment il ment.

Vos options#

Quatre directions, chacune avec ses contraintes réelles et une chose que vous pouvez tester cette semaine. Continuer comme aujourd'hui est un choix légitime — il faut simplement que ce soit un choix.

Rester et se renforcer

Détenez l'évaluation, non le modèle

Quand écrire l'expérience est délégué et la lire ne l'est pas, la position rare est celle qui décide ce qui compte comme résultat. La conception d'évaluations est aussi la part que les publications du domaine nomment comme retardataire : les capacités faciles à mesurer s'améliorent plus vite que les difficiles, ce qui est une affirmation sur les instruments de mesure devenus le goulot.

Contraintes réelles

Le travail d'évaluation est jugé sur la fréquence à laquelle il dit non, dans des organisations qui mesurent le progrès par les lancements. C'est aussi le travail le plus susceptible d'être confié à un junior précisément parce qu'il ressemble à de l'infrastructure.

À tester cette semaine

Prenez le dernier résultat que votre équipe a célébré et essayez de le produire par une voie qui ne devrait pas marcher. Si vous n'en approchez pas, le résultat est plus solide que vous ne pensiez ; si vous y arrivez, vous avez trouvé quelque chose que personne ne cherchait.

Refaçonner le poste

Devenez celui qui mène plusieurs lignes à la fois

Le glissement mesuré va vers des chercheurs qui tiennent plusieurs sessions d'agents simultanées, et le mode de défaillance rapporté n'est pas l'incapacité de l'agent mais le fait que la personne ne remarque pas où il a dérapé. C'est une compétence de supervision sans voie de formation établie, raison précise pour laquelle la détenir tôt vaut quelque chose.

Contraintes réelles

Cela échange la profondeur contre l'étendue à un stade de carrière où la profondeur est ce qui fait recruter, et la publication elle-même note que diriger devient plus difficile à mesure que les tâches s'allongent. Cela dépend aussi d'un budget de calcul que la plupart des gens ne contrôlent pas.

À tester cette semaine

Menez deux tâches d'agent en parallèle pendant une après-midi et notez, pour chaque intervention, le signal exact qui vous a dit d'intervenir. Si la liste est vide, vous ne supervisiez pas, vous attendiez.

Mouvement latéral

Allez là où la contrainte est le jugement

Les domaines où une expérience est coûteuse, lente ou irréversible — biologie, matériaux, médecine, matériel — ne peuvent pas déléguer la campagne à un agent : toute la valeur tient donc au choix de l'expérience à faire. Les compétences de méthode se transfèrent ; le faible coût qui a rendu délégable la phase de construction de ce métier n'existe pas là-bas.

Contraintes réelles

Cela suppose de repartir sur un savoir métier qui prend des années, et le temps de cycle qui protège le travail ralentit aussi votre propre apprentissage au rythme des expériences.

À tester cette semaine

Trouvez une personne d'un tel domaine et demandez combien de temps a pris sa dernière expérience et ce qu'il coûtait de se tromper. Comparez à votre propre semaine. L'écart est ce que vous achèteriez.

Questions fréquentes#

Combien de temps me reste-t-il ?

Aucune année, et dans ce métier une année serait particulièrement malhonnête, parce que les personnes les mieux placées pour savoir se contredisent en public. Ce que vous pouvez mesurer vous-même est plus utile. Sur vos dix derniers travaux, comptez combien ont fini en code que vous avez écrit et combien en jugement sur un travail produit par autre chose. Puis comptez, parmi les tâches d'agent réussies, combien vous avez dû interrompre. Le premier rapport vous dit quelle moitié de ce métier vous détenez aujourd'hui ; le second vous dit si cette moitié porte encore la charge. Les deux chiffres existent dans votre propre semaine et aucun n'exige la prévision de quiconque.

Ceux qui construisent l'IA disent que l'IA fera bientôt la recherche en IA. Faut-il les croire ?

Traitez la déclaration et la mesure comme deux choses différentes, parce qu'elles sont publiées dans des documents différents et qu'une seule est vérifiable. Les mesures — jours-agent par jour humain, taux d'intervention, part de la production qui est de la planification de haut niveau — sont précises, datées, et pourraient être contredites par une publication ultérieure. Les attentes sur ce qui vient ensuite sont des attentes : elles viennent de gens à la visibilité inhabituelle et à l'intérêt inhabituel, et les deux tirent dans le même sens. Ce site enregistre le premier type et non le second, et c'est une limite délibérée plutôt qu'un avis sur qui a raison.

Un doctorat a-t-il encore du sens ici ?

La question est d'ordinaire posée comme si le doctorat était une formation à construire des choses, et il ne l'est pour l'essentiel pas. Ce qu'un doctorat est réellement — quatre ans de pratique — c'est la tâche que cette page marque comme restant aux personnes : décider ce qui mérite d'être étudié, et défendre une affirmation sur un résultat devant des gens qui cherchent à la casser. C'est la moitié rare. La mise en garde honnête diffère de l'habituelle : la moitié bon marché du métier est là où un étudiant se prouve désormais devant un jury de recrutement, et si c'est tout ce qu'un programme vous apprend, la formation et le marché ont divergé. Demandez au groupe que vous rejoignez à quelle fréquence le résultat d'un étudiant est démonté devant lui, et à quand remonte l'abandon d'une direction là-bas.

Est-ce le même métier qu'ingénieur en apprentissage automatique ?

Non, et le site les garde séparés exprès parce que leur exposition diffère. Un ingénieur en apprentissage automatique livre un système qui tourne sur de vraies personnes, et ce qui a déplacé une grande part de ce travail est un substitut achetable — un modèle entraîné par quelqu'un d'autre. Un chercheur livre une conclusion, et ce qui y est délégué est le labeur de produire des preuves pour elle, non la conclusion. Une conséquence compte pour qui choisit : l'éviction de l'ingénieur est réversible, parce que le prix ou la licence d'un fournisseur peut bouger ; celle du chercheur n'a pas du tout cette forme. Si votre travail s'achève quand quelque chose est livré, lisez plutôt la page de l'ingénieur en apprentissage automatique.

Écrit à ce sujet#

Ces textes raisonnent à partir des mêmes dossiers que contient cette page, et chacune de leurs sections nomme ce sur quoi elle repose.

  • Pourquoi personne ne peut vous dire combien de temps il reste

Méthode et sources#

Date d'évaluation
2026-09-13
Fondement des jugements de tâche
5 appuyés sur des preuves · 1 inférence de plateforme · 0 preuves insuffisantes
Événements vérifiés
5

Comment nous évaluons un métier →