使用者による採用認知の自動化2024-03-11
複数のAI学会の査読の文章の6.5%から16.9%は言語モデルによって大幅に修正された可能性がある、とスタンフォード大学の研究は推計した
大学教員職業のページ →出来事の日付 / 報じられた日
2024-03-11
証拠の段階
使用者による採用ある道具が実際の仕事のために大規模に使われていることが測定されており、しかも使うと決めたのが雇用主ではなく働き手である場合。capability の記録より重い——仕事が実演ではなく本物だからである——そして deployment の記録より軽い。どの雇用主もそれを本番に置いておらず、求めてもおらず、その周りに工程も作っていないからである。重みは `cautious` である——`automating` とは、機械がその業務をできることと、採用の兆しがあることの両方を意味し、これは採用の兆しである——しかし利用は試験的でありうるし、測定の多くは利害のある側から来るので、一件では決して足りず、独立した二件で足りる。誰が数えているかに注意すること。ベンダーの計測データはこれを直に見るが、その道具を売っているので、そうした記録は適用範囲にその利害を明記する。統計機関が企業に「働き手は業務でAIを使っているか」を尋ねる場合、同じ経路を何の利害もなく見ており、それが存在するならそちらが良い出典である。
これが関わる業務
査読
他の研究者の論文や申請書を査読する。
いまも人が主導✓ 証拠に基づく
どこに当てはまるか
AI学会(ICLR、NeurIPS、CoRL、EMNLP)の査読。集団レベルの推定手法を使って、この研究は、これらの学会に査読として提出された文章の6.5%から16.9%が、スペルチェックや軽微な文章の手直しを超えて、LLM によって大幅に修正された可能性があると報告している。対象はAI学会だけであり、推計しているのは文章の割合であって、個々の査読者ではない。
これが意味すること
少なくともAI研究では、査読者はすでに査読に言語モデルを使っている。そこから生まれる規則は、何を任せてよいか、何をいまも自分で判断しなければならないかについてのものになる。
これがまだ示していないこと
AI学会だけが対象であり、推計しているのは文章の割合であって、査読の質や判断がどう変わったかではない。
あなたに確かめられること
arXiv 2403.07183 を開き、要旨のなかで「between 6.5% and 16.9%」を探すこと。
評価を変えるか
いいえ。影響指数は一件の出来事で動くことはありませんし、この段階はそれ単独では判断も動かしません——「使用者による採用」の記録は判断に向けて数えられますが、その判断が証拠の上に立つには、独立した二件目が要ります。この一件は数えられました。単独では何も変えていません。
出典
Liang, Izzo, Zhang et al. (Stanford University) — Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews, arXiv 2403.07183 (submitted 11 Mar 2024; ICML 2024) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。