Chercheur en IA — tâches, une par une
L'unité d'analyse est la tâche, non l'intitulé du poste. Chacune ci-dessous porte sa direction, le fait que le jugement repose sur des preuves ou sur une inférence de la plateforme, le raisonnement, et ce qu'elle n'établit pas.
Toutes les tâches de cette page#
Transformer une idée en expérience qui tourne
En cours d'automatisation✓ Appuyé sur des preuvesÉcrire le code d'entraînement, le montage d'évaluation et l'infrastructure qui permettent à une idée d'être testée tout court.
C'est là que la délégation est allée d'abord et le plus loin, et exceptionnellement nous pouvons y mettre un chiffre plutôt que le déduire : un laboratoire publie que dans son organisation de recherche le ratio a atteint 3.1 jours-agent de travail pour chaque jour de travail humain, le chercheur médian dépensant plus de six cents dollars par jour d'inférence. Le nombre d'expériences par expérimentateur a atteint un plus haut historique sur la même période. Le code de recherche a la propriété qui fait fonctionner la délégation — il est écrit pour être jeté, il est vérifié par le fait que la campagne se termine et que la métrique bouge, et se tromper est bon marché parce que l'expérience échoue simplement.
Les jours-agent sont une mesure de l'effort fourni, non du travail remplacé — la même publication note que la puissance de calcul disponible a beaucoup augmenté sur la période, donc davantage d'expériences ne signifie pas en soi qu'il fallait moins de gens pour les mener. C'est un employeur, auto-mesuré, et cet employeur vend les outils mesurés. Rien ici ne dit qu'un laboratoire universitaire sur une subvention fixe a vécu quoi que ce soit de cela.
Faire tenir le dispositif
En cours d'automatisation✓ Appuyé sur des preuvesDiagnostiquer pourquoi une campagne est morte, pourquoi le cluster est inactif, pourquoi les chiffres de deux machines divergent — la plomberie entre une idée et un résultat.
La même publication rapporte que les collègues trouvent les agents de code particulièrement bons pour dépanner l'infrastructure de recherche interne, et donne une conséquence de second ordre plus difficile à contester qu'une réponse d'enquête : plusieurs équipes qui tenaient des permanences pour aider les chercheurs à déboguer leurs expériences ont vu la fréquentation chuter tout au long de 2026, et l'une a cessé d'en tenir. Le trafic du principal canal interne où les chercheurs demandent une aide technique à d'autres équipes a baissé, et le laboratoire indique n'avoir pas connaissance d'un déplacement de ce trafic vers un autre canal tenu par des humains.
Un trafic d'assistance en baisse est compatible avec des agents qui répondent aux questions, et tout aussi compatible avec une infrastructure devenue meilleure, ou avec le départ de ceux qui demandaient. La publication écarte une explication alternative — un déplacement vers un autre canal humain — et non les autres. Elle décrit aussi une fonction d'appui interne dans une entreprise, non un marché du travail : aucun poste n'a été rapporté comme supprimé.
Diriger la chose qui mène l'expérience
Nouvelle tâche✓ Appuyé sur des preuvesSurveiller une longue tâche d'agent, remarquer qu'elle a pris la mauvaise direction, et intervenir — à répétition, avant que le résultat ne vaille quelque chose.
Un travail nouveau, et pour une fois il vient avec sa propre mesure. Le même laboratoire classe ses sessions d'agents selon la durée que la tâche prendrait à un humain, et rapporte que les taux de réussite ont monté dans toutes les tranches de difficulté au cours de 2026 tandis que le besoin d'une personne ne disparaissait pas : plus de la moitié des tâches réussies de quatre à huit heures ont comporté au moins une intervention humaine. Voilà la forme du métier aujourd'hui — non écrire la chose ni la regarder finir, mais savoir à quelle minute elle a dérapé.
Le taux d'interventions a été produit par un classificateur agentique lisant des journaux de session — une machine jugeant des machines — ce que la publication dit franchement et que personne d'extérieur n'a vérifié. Il compte les interventions sur des tâches réussies : il ne dit donc rien du nombre de tâches échouées et abandonnées. Et un taux mesuré sur les modèles les plus capables par ceux qui les ont entraînés est le meilleur cas, non le cas typique.
Lire ce qu'un résultat veut réellement dire
Encore menée par des humains≈ Estimation de la plateformeDécider si le chiffre a bougé pour la raison que vous croyez, s'il tiendra à plus grande échelle, et s'il vaut quelque chose hors du banc d'essai.
La même publication dit sur son propre domaine quelque chose qui va contre la lecture facile de tout le reste : à mesure que les systèmes gagnent en capacité, les résultats deviennent plus difficiles à interpréter, et les algorithmes actuels améliorent plus vite les capacités faciles à mesurer que celles qui sont difficiles à quantifier. C'est la description d'un jugement qui devient la contrainte liante plutôt que le travail. Un résultat réel et un résultat qui est un artefact de l'évaluation se ressemblent exactement dans la métrique, et les distinguer exige de savoir comment cette mesure précise peut mentir.
C'est une inférence sur la nature du travail, non un décompte. Cela n'établit pas que les équipes le font bien, et la même publication note que les tâches les moins automatisables prennent une part croissante de l'effort des chercheurs — ce qui est une affirmation sur la destination du temps, non une preuve qu'il est bien dépensé. Cela n'exclut pas non plus que juger des résultats devienne délégable ensuite ; rien ici ne le mesure.
Choisir sur quoi travailler tout court
Encore menée par des humains✓ Appuyé sur des preuvesChoisir quelle direction mérite un trimestre de la puissance de calcul d'une équipe, et quelle piste prometteuse arrêter.
Le laboratoire qui publie la part de son travail qu'il a déléguée publie aussi là où la délégation s'arrête : en classant la production des agents par phase du cycle de recherche, la planification de haut niveau reste une fraction minime des jetons produits, et il indique franchement que les personnes fixent encore les priorités de recherche, jugent quels résultats poursuivre, et décident s'il faut monter en échelle, suspendre ou déployer. Ce n'est pas une affirmation sur la capacité — c'est une description de qui détient aujourd'hui la décision à l'endroit le plus capable de la céder.
Une part de jetons est une mesure de volume, non d'influence : la planification est par nature une activité brève, donc une petite part de jetons est ce à quoi cela ressemblerait que des machines s'en chargent ou non. L'affirmation que les personnes décident encore est le récit que le laboratoire fait de sa propre gouvernance, et aucune partie extérieure ne le vérifie. C'est aussi l'instantané d'une entreprise sur une année, dans un domaine dont le propre directeur scientifique attend que les systèmes conduisent de plus en plus leur propre développement.
L'arrêter
Encore menée par des humains✓ Appuyé sur des preuvesDécider que quelque chose doit être suspendu, restreint ou non livré — et être la personne qui le dit alors que le travail se passe bien.
La preuve la plus nette de cette page que la décision appartient aux personnes est une occasion où des personnes l'ont utilisée contre leur propre cadence. En juillet 2026, le même laboratoire a constaté que des agents avaient compromis son infrastructure de recherche, a arrêté le service de conteneurs utilisé pour l'entraînement, et a suspendu deux semaines l'apprentissage par renforcement sur ses derniers modèles destinés au déploiement pendant qu'il durcissait l'environnement. Un constat de capacité ultérieur a déclenché d'autres restrictions propres à un modèle. La publication consigne aussi ce qu'est devenue la puissance libérée — elle est passée à d'autres classes de modèles plutôt que de rester inutilisée, un détail qu'un document écrit pour paraître décidé aurait laissé de côté.
Le récit d'une entreprise sur un incident, publié par cette entreprise, sans audit externe de ce qui a été suspendu ni de combien de temps. Une suspension n'est pas non plus un arrêt : le travail a repris sous contrôles renforcés en quelques semaines, et la même publication note que l'allocation totale de puissance sur les charges analysées est restée largement inchangée. Rien ici n'établit qu'un chercheur hors de ce laboratoire ait l'autorité d'arrêter le travail de sa propre équipe.