技术能力脑力工作自动化2024-06-26
在雷丁大学,94% 由 AI 撰写的考试答卷未被发现,平均得分还比真实学生高半个等级
大学教师职业页 →事件日期 / 报道日期
2024-06-26
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
考核设计与学术诚信
设计能检验学生能力的考试与作业,维护学术诚信。
新出现的任务✓ 有证据支撑
适用范围
英国,一所大学心理学系的考试。研究者在阅卷人不知情的情况下,向真实的课后考试提交 AI 撰写的答卷,报告 94% 的 AI 答卷未被发现(按更严格的标准为 97%),获得的分数平均比真实学生高半个等级。这只是一个系、一批考试,用的是 2023 年的模型;作者声明无利益冲突。
这意味着什么
无人监考的书面考核已不能可靠地衡量学生的能力。随之而来的工作 —— 重新设计考核 —— 落在了大学教师身上。
还不能说明什么
这是一个系、用较早模型的考试;没有测量各大学的实践。
你可以核实什么
打开 Scarfe 等人 2024 年发表于《PLOS ONE》的文章,找到 "94% of our AI submissions were undetected"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Scarfe, Watcham, Clarke et al. (University of Reading) — A real-world test of artificial intelligence infiltration of a university examinations system: A 'Turing Test' case study, PLOS ONE (published June 26, 2024) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。