技术能力脑力工作自动化2023-09-25
一项专家评估发现:语言模型写的故事通过的创造力测试,比职业作家的故事少 3–10 倍
作家与编剧职业页 →事件日期 / 报道日期
2023-09-25
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
写小说与写书
起草长篇、短篇小说和非虚构图书。
正在被增强≈ 平台推断
适用范围
一项研究:10 名创意写作者用一套创造力测试,评估了 48 篇分别由职业作家或语言模型写的故事。作者报告,模型写的故事通过的测试比职业作家的少 3–10 倍,而用作评估者的模型没有一个与专家评分正相关。它使用的是 2023 年的模型;合著者包括一家 AI 公司的研究人员。
这意味着什么
在作家的评判下,直接提示的模型写的故事远不及职业小说 —— 2023 年的技艺差距很大。
还不能说明什么
2023 年的模型和少量故事;较新的模型和微调会改变这一图景。
你可以核实什么
打开 arXiv 论文《Art or Artifice?》(2309.14556),找到 "3-10X less TTCW tests"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Chakrabarty, Laban, Agarwal, Muresan and Wu (Columbia University and Salesforce AI Research) — Art or Artifice? Large Language Models and the False Promise of Creativity, arXiv:2309.14556 (CHI 2024; submitted 25 Sep 2023) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。