技術的能力認知の自動化2024-07-01
世界的な小説家が短編小説の文芸批評家による評価で GPT-4 Turbo を上回り、モデルが一流の書き手に挑むにはまだほど遠い、と研究者らは結論づけた
作家・著述家職業のページ →出来事の日付 / 報じられた日
2024-07-01
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
小説と本を書く
長編小説、短編、ノンフィクションの本を書き下ろす。
増強されつつある≈ 本サイトの推定
どこに当てはまるか
小説家 Patricio Pron と GPT-4 Turbo が同じ題名から短編小説を書き、英語とスペイン語の文芸批評家と研究者が評価した対決。著者らは、言語モデルが一流の人間の創作者に挑むにはまだほど遠いこと、そして GPT-4 は自分で考えた題名よりも小説家の題名を与えられたときのほうが創造的に書いたことを報告している。比べているのは一人の作家と一つのモデルである。
これが意味すること
技巧の頂点では、小説家はいまもはっきりとモデルに勝った——そしてモデルは、自分の発想よりも小説家の発想を使ったほうがうまく書いた。
これがまだ示していないこと
一人の小説家と2024年の一つのモデルの対決である。平均的な書き手や新しいモデルについては何も語っていない。
あなたに確かめられること
arXiv の論文「Pron vs Prompt」(2407.01119)を開き、「still far from challenging a top human creative writer」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Marco, Gonzalo, Mateo and del Castillo (UNED and Universidad Complutense de Madrid) — Pron vs Prompt: Can Large Language Models already Challenge a World-Class Fiction Author at Creative Text Writing?, arXiv:2407.01119 (EMNLP 2024; submitted 1 Jul 2024) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。