技術的能力認知の自動化2024-09-13
試験官は、模擬口頭専門医試験で ChatGPT と麻酔科フェローの総合得点に有意差を認めなかったが、24モジュールのうち23で機械の答えを見分けた
麻酔科医職業のページ →出来事の日付 / 報じられた日
2024-09-13
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
術前評価と計画
患者を診察し、病歴と服薬とリスクを確かめ、麻酔の計画を決める。
増強されつつある≈ 本サイトの推定
どこに当てはまるか
四人の麻酔科フェローと ChatGPT を、米国の二つの模擬口頭専門医試験で比べた探索的研究。この試験は判断力と予期しない臨床上の変化への適応を問うもので、八人の試験官が音声再現装置を使って盲検で採点した。フェローはモジュールの主題で上回ったが、モジュールの総合得点に有意差はなく、試験官は24モジュールのうち23で ChatGPT の答えを見分けた。模擬試験についての小規模な研究である。
これが意味すること
判断力を問う試験で、モデルの得点は研修医に近かったが、試験官はそれでも見分けることができた。
これがまだ示していないこと
四人の研修医と二つの模擬試験である。実際の患者の診療は測っていない。
あなたに確かめられること
Anesthesia & Analgesia の研究(doi 10.1213/ane.0000000000006875)を開き、「23 of 24 modules」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Blacker et al. — An Exploratory Analysis of ChatGPT Compared to Human Performance With the Anesthesiology Oral Board Examination: Initial Insights and Implications, Anesthesia & Analgesia (published online 13 September 2024) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。