技術的能力認知の自動化2024-06-26
AIが書いた試験答案の94%がレディング大学で見抜かれず、平均して実際の学生より成績区分で半段階高い点を得た
大学教員職業のページ →出来事の日付 / 報じられた日
2024-06-26
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
評価の設計と誠実さ
学生にできることを測る試験や課題を設計し、学問上の誠実さを守る。
新しい業務✓ 証拠に基づく
どこに当てはまるか
英国、一つの大学の心理学の試験。研究者らは採点者に知らせずに、実際の持ち帰り試験にAIが書いた答案を提出し、AIの答案の94%が見抜かれず、より厳しい基準でも97%が見抜かれなかったこと、与えられた成績が平均して実際の学生より成績区分で半段階高かったことを報告している。一つの学科の一回分の試験であり、使われたのは2023年頃のモデルである。著者らは利益相反はないと申告している。
これが意味すること
監督のない筆記の評価は、もはや学生にできることを確実には測れない。その後に来る仕事——評価の設計し直し——は大学教員にかかる。
これがまだ示していないこと
古いモデルを使った一つの学科の試験であり、大学全体での実務を測ってはいない。
あなたに確かめられること
Scarfe et al.(2024)の PLOS ONE 論文を開き、「94% of our AI submissions were undetected」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Scarfe, Watcham, Clarke et al. (University of Reading) — A real-world test of artificial intelligence infiltration of a university examinations system: A 'Turing Test' case study, PLOS ONE (published June 26, 2024) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。