技术能力脑力工作自动化2024-01-02
研究者发现:通用语言模型回答随机抽取的联邦法院案件问题时,出错的比例在 58% 到 88% 之间
法官职业页 →事件日期 / 报道日期
2024-01-02
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
研究法律
查找并阅读案件所依据的法条、判例和权威资料。
正在被增强✓ 有证据支撑
适用范围
一项研究:向通用语言模型提出关于随机抽取的联邦法院案件的具体、可核实的问题,发现法律幻觉的比例在 ChatGPT 4 的 58% 到 Llama 2 的 88% 之间,而且模型常常不会纠正用户错误的法律前提。这是 2023 年的较旧模型,与本页那项法律检索工具研究出自同一研究组。
这意味着什么
通用聊天机器人在案件事实上比专用工具更差 —— 这也是司法机构提醒不要用公共聊天机器人的一个原因。
还不能说明什么
这是较旧的模型;与这里的另一项研究出自同一实验室,并不独立。
你可以核实什么
打开 arXiv 2401.01301,找到 "between 58% of the time with ChatGPT 4 and 88% with Llama 2"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Dahl et al. — Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models (arXiv 2401.01301, submitted 2 Jan 2024) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。