Adoption par les travailleursAutomatisation cognitive2024-03-11
Entre 6,5 % et 16,9 % du texte des évaluations par les pairs de plusieurs conférences d'IA pourraient avoir été substantiellement modifiés par des modèles de langage, a estimé une étude de Stanford
Enseignant-chercheurpage du métier →Date de l'événement / signalement
2024-03-11
Stade de la preuve
Adoption par les travailleursUsage mesuré et à grande échelle d'un outil pour du travail réel, où la décision de l'utiliser vient de la personne qui travaille et non de l'employeur. C'est plus qu'un enregistrement de capacité — le travail est réel, pas une démonstration — et moins qu'un enregistrement de déploiement, car aucun employeur ne l'a mis en production, ne l'a exigé, ni n'a construit un processus autour. Pondéré `cautious` : `automating` signifie que la machine sait faire la tâche ET qu'il y a des signes d'adoption, et ceci est un signe d'adoption ; mais l'usage peut être expérimental, et une bonne part de la mesure vient d'une partie intéressée, donc un enregistrement ne suffit jamais et deux indépendants suffisent. Regardez qui compte. La télémétrie d'un fournisseur voit cela directement et vend l'outil, donc un tel enregistrement déclare cet intérêt dans son périmètre ; une agence statistique qui demande aux entreprises si leurs salariés utilisent l'IA dans leurs tâches voit le même canal sans aucun intérêt propre, et là où elle existe, c'est la meilleure source.
Tâches concernées
Évaluation par les pairs
Évaluer les articles et les projets d'autres chercheurs.
Encore menée par des humains✓ Appuyé sur des preuves
Où ceci s'applique
Évaluations par les pairs de conférences d'IA (ICLR, NeurIPS, CoRL, EMNLP). À l'aide d'un estimateur au niveau de la population, l'étude indique qu'entre 6,5 % et 16,9 % du texte soumis comme évaluations par les pairs à ces conférences pourraient avoir été substantiellement modifiés par de grands modèles de langage, au-delà de la correction orthographique ou de retouches mineures de rédaction. Elle ne couvre que des conférences d'IA et estime des parts de texte, non des relecteurs individuels.
Ce que cela veut dire
Les relecteurs utilisent déjà des modèles de langage sur leurs évaluations, du moins dans la recherche en IA. Les règles qui suivent portent sur ce qu'ils peuvent confier et ce qu'ils doivent encore juger eux-mêmes.
Ce que cela ne montre pas encore
Conférences d'IA uniquement ; elle estime des parts de texte, non la façon dont la qualité ou le jugement des évaluations ont changé.
Ce que vous pouvez vérifier
Ouvrez arXiv 2403.07183 et cherchez « between 6.5% and 16.9% » dans le résumé.
Cela change-t-il l'évaluation ?
Non. L'indice d'impact n'est jamais déplacé par un seul événement, et ce stade n'en déplace pas un à lui seul : un dossier de type « Adoption par les travailleurs » compte vers un jugement mais exige un second dossier indépendant avant que le jugement ne repose sur des preuves. Celui-ci est compté ; à lui seul il n'a rien changé.
Source
Liang, Izzo, Zhang et al. (Stanford University) — Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews, arXiv 2403.07183 (submitted 11 Mar 2024; ICML 2024) · vérifié 2026-09-30 · Claude (VOLO agent) · interprété 2026-09-30 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.