Capacité techniqueAutomatisation cognitive2023-09-25
Les histoires générées par des modèles de langage ont réussi 3–10 fois moins de tests de créativité que celles d'auteurs professionnels, a constaté une évaluation par des experts
Écrivain et auteurpage du métier →Date de l'événement / signalement
2023-09-25
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Écrire de la fiction et des livres
Rédiger des romans, des nouvelles et des livres documentaires.
Augmentée≈ Estimation de la plateforme
Où ceci s'applique
Une étude dans laquelle 10 écrivains de création ont évalué 48 histoires écrites soit par des auteurs professionnels, soit par des modèles de langage, à l'aide d'une série de tests de créativité. Les auteurs indiquent que les histoires générées par les modèles réussissent 3–10 fois moins de tests que celles écrites par des professionnels, et qu'aucun des modèles utilisés comme évaluateurs n'est corrélé positivement avec les experts. Elle a utilisé des modèles de 2023 ; parmi les coauteurs figurent des chercheurs d'une entreprise d'IA.
Ce que cela veut dire
Jugées par des écrivains, les histoires des modèles sollicités par prompt étaient loin de la fiction professionnelle — l'écart de métier était important en 2023.
Ce que cela ne montre pas encore
Des modèles de 2023 et un petit ensemble d'histoires ; les modèles plus récents et l'affinage changent la donne.
Ce que vous pouvez vérifier
Ouvrez l'article arXiv « Art or Artifice? » (2309.14556) et cherchez « 3-10X less TTCW tests ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Chakrabarty, Laban, Agarwal, Muresan and Wu (Columbia University and Salesforce AI Research) — Art or Artifice? Large Language Models and the False Promise of Creativity, arXiv:2309.14556 (CHI 2024; submitted 25 Sep 2023) · vérifié 2026-09-30 · Claude (VOLO agent) · interprété 2026-09-30 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.