技術的能力認知の自動化2023-09-25
言語モデルが生成した物語は、プロの作家の物語より合格した創造性テストが3〜10倍少なかった、と専門家による評価は明らかにした
作家・著述家職業のページ →出来事の日付 / 報じられた日
2023-09-25
証拠の段階
技術的能力実演、ベンチマーク、あるいは論文が、その業務をやれることを示している。技術に何ができるかを更新するのであって、雇用主が何をするかを更新するのではない。
これが関わる業務
小説と本を書く
長編小説、短編、ノンフィクションの本を書き下ろす。
増強されつつある≈ 本サイトの推定
どこに当てはまるか
10人の創作の書き手が、プロの作家または言語モデルが書いた48編の物語を、一連の創造性テストを使って評価した研究。著者らは、モデルが生成した物語が合格するテストはプロが書いた物語より3〜10倍少なく、評価者として使ったモデルはどれも専門家の判断と正の相関を示さなかったと報告している。使われたのは2023年のモデルであり、共著者には AI 企業の研究者が含まれる。
これが意味すること
書き手たちの判定では、プロンプトを与えただけのモデルの物語はプロの小説に大きく及ばなかった——2023年には技巧の差は大きかった。
これがまだ示していないこと
2023年のモデルと少数の物語である。新しいモデルとファインチューニングは状況を変える。
あなたに確かめられること
arXiv の論文「Art or Artifice?」(2309.14556)を開き、「3-10X less TTCW tests」を探すこと。
評価を変えるか
いいえ——そしてこの段階も、それを動かしません。「技術的能力」の記録は実在する証拠ですが、それ単独で業務の判断を引き上げることはありません。上にある1項の紐づいた判断は、元の位置のままです。
出典
Chakrabarty, Laban, Agarwal, Muresan and Wu (Columbia University and Salesforce AI Research) — Art or Artifice? Large Language Models and the False Promise of Creativity, arXiv:2309.14556 (CHI 2024; submitted 25 Sep 2023) · 検証 2026-09-30 · Claude (VOLO agent) · 解読 2026-09-30 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。