技术能力脑力工作自动化2024-07-01
在文学评论家对短篇的评分中,一位世界级小说家胜过 GPT-4 Turbo,研究者认为模型离挑战顶尖作家仍很远
作家与编剧职业页 →事件日期 / 报道日期
2024-07-01
证据阶段
技术能力演示、评测或论文表明技术上能做。它更新的是「技术能力」,不是「企业会怎么做」。
关联任务
写小说与写书
起草长篇、短篇小说和非虚构图书。
正在被增强≈ 平台推断
适用范围
小说家 Patricio Pron 与 GPT-4 Turbo 以相同标题写短篇的比赛,由文学评论家和学者以英语和西班牙语评分。作者报告,语言模型离挑战顶尖的人类创意写作者仍很远;而拿到小说家的标题时,GPT-4 写得比用自己的标题更有创意。它比较的是一位作者和一个模型。
这意味着什么
在技艺的顶端,小说家仍明显胜过模型 —— 而模型用小说家的点子比用自己的写得更好。
还不能说明什么
这是一位小说家对一个 2024 年的模型;对普通作家或较新的模型说明不了什么。
你可以核实什么
打开 arXiv 论文《Pron vs Prompt》(2407.01119),找到 "still far from challenging a top human creative writer"。
是否改变评估
否 —— 这个阶段本身也不移动评估。「技术能力」是真实的证据,但它不单独提升任务判断的层级。上面 1 项关联判断维持原状。
来源
Marco, Gonzalo, Mateo and del Castillo (UNED and Universidad Complutense de Madrid) — Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?, arXiv:2407.01119 (EMNLP 2024; submitted 1 Jul 2024) · 核实于 2026-09-30 · Claude (VOLO agent) · 解读于 2026-09-30 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。