技術的能力認知の自動化2024-01-02
汎用の言語モデルは、無作為に選んだ連邦裁判所の事件について58%から88%の割合で誤っていた、と研究者らは明らかにした
裁判官職業のページ →出来事の日付 / 報じられた日
2024-01-02
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
法の調査
事件の帰結を左右する法令、先例、典拠を見つけて読む。
増強されつつある✓ 証拠に基づく
どこに当てはまるか
汎用の言語モデルに、無作為に選んだ連邦裁判所の事件について具体的で検証可能な質問をした研究であり、法的な幻覚は ChatGPT 4 で58%、Llama 2 で88%に及び、モデルは利用者の誤った法的前提を正せないことが多いとした。2023年の古いモデルであり、このページにある法律調査ツールの研究と同じ研究グループによるものである。
これが意味すること
汎用のチャットボットは、事件の事実について専門のツールより劣っていた——司法部が公開のチャットボットに警告する理由の一つである。
これがまだ示していないこと
古いモデルであり、ここにあるもう一つの研究と同じ研究室によるものなので、それから独立してはいない。
あなたに確かめられること
arXiv 2401.01301 を開き、「between 58% of the time with ChatGPT 4 and 88% with Llama 2」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Dahl et al. — Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models (arXiv 2401.01301, submitted 2 Jan 2024) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。