試行認知の自動化2025-04-13
査読にAIのフィードバックを受けた ICLR 2025 の査読者の27%が査読を更新した——20,000件の査読を対象とするランダム化研究
大学教員職業のページ →出来事の日付 / 報じられた日
2025-04-13
証拠の段階
試行実際の場での小規模な試行。導入の条件が試されていることを教えてくれるのであって、それが成り立つことを教えてくれるのではない——だから一件の試行は単独では決して足りず、独立した二件で足りる。
これが関わる業務
査読
他の研究者の論文や申請書を査読する。
いまも人が主導✓ 証拠に基づく
どこに当てはまるか
2025年の、あるAI学会の査読プロセス。ランダム化研究のなかで、LLMベースのエージェントが査読者に査読へのフィードバックを返した。論文は、フィードバックを受けた査読者の27%が査読を更新し、12,000件を超えるフィードバックの提案が取り入れられたと報告している。著者らは自分たちが評価するシステムを自ら作っており、実施されたのは一つの学会である。
これが意味すること
AIが査読者を査読するために使われはじめている——査読のどこが曖昧か、不公平かを指摘する——そして査読者はそれに応じて動いている。論文についての判断は査読者のものであり続ける。
これがまだ示していないこと
一つの学会で、システムを作った人たち自身による評価である。
あなたに確かめられること
arXiv 2504.09737 を開き、「27% of reviewers who received feedback updated their reviews」を探すこと。
評価を変えるか
いいえ。影響指数は一件の出来事で動くことはありません。この記録がやったのは、上にある1項の紐づいた業務の判断が、推定ではなく証拠の上に立つようになった、ということです。
出典
Thakkar, Yuksekgonul, Silberg et al. — Can LLM feedback enhance review quality? A randomized study of 20K reviews at ICLR 2025, arXiv 2504.09737 (submitted 13 Apr 2025) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。