技术能力脑力工作自动化2024-09-13
在口试样题上,考官发现 ChatGPT 与麻醉专科培训医生的总体得分没有显著差异,却在 24 个模块中认出了 23 个机器写的答案
麻醉医生职业页 →事件日期 / 报道日期
2024-09-13
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
术前评估与麻醉计划
检查病人,审阅病史、用药和风险,并决定麻醉方案。
正在被增强≈ 平台推断
适用范围
这是一项探索性研究,在两套美国口试样题上比较四名麻醉专科培训医生与 ChatGPT;这种考试考的是判断力和应对意外临床变化的能力,由八名考官借助语音复制软件盲评。培训医生在模块主题得分上更好,模块总体得分没有显著差异,考官在 24 个模块中认出了 23 个 ChatGPT 的答案。这是一项基于样题的小型研究。
这意味着什么
在考判断力的考试上,模型得分接近培训医生,而考官仍能把它认出来。
还不能说明什么
这是四名培训医生和两套样题;没有测量对真实病人的诊疗。
你可以核实什么
打开《麻醉与镇痛》上的这项研究(doi 10.1213/ane.0000000000006875),找到 "23 of 24 modules"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Blacker et al. — An Exploratory Analysis of ChatGPT Compared to Human Performance With the Anesthesiology Oral Board Examination: Initial Insights and Implications, Anesthesia & Analgesia (published online 13 September 2024) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。