技术能力脑力工作自动化2025-10-27
GPT-4o 在一项国家级麻醉专科考试中答对 83.69%,但在应用和分析题上表现更差,最常见的错误是没有依据的医学论断
麻醉医生职业页 →事件日期 / 报道日期
2025-10-27
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
术前评估与麻醉计划
检查病人,审阅病史、用药和风险,并决定麻醉方案。
正在被增强≈ 平台推断
适用范围
这项研究让 GPT-4o 30 次作答智利 183 道题的麻醉专科认证考试。总体正确率为 83.69%,理解和记忆类最高,应用类(76.83%)和分析类(76.54%)较低。在错误答案中,最常见的是没有依据的医学论断。作者说,它在高阶推理和诊断判断上的局限,意味着在用于临床之前需要更多保障措施。
这意味着什么
语言模型掌握了考试的大部分内容,而在需要判断的地方最弱。
还不能说明什么
这是考试,不是病人;答题的正确率不等于手术室里的安全。
你可以核实什么
打开《BMC 医学教育》上的这项研究(doi 10.1186/s12909-025-08084-9),找到 "overall accuracy of 83.69%"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Altermatt et al. — Evaluating GPT-4o in high-stakes medical assessments: performance and error analysis on a Chilean anesthesiology exam, BMC Medical Education 25 (27 October 2025) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。