Capacité techniqueAutomatisation cognitive2024-10-09
Les meilleurs modèles de langage n'ont atteint que 30,5 % de précision sur DA-Code, un banc d'essai de tâches de programmation en science des données confiées à des agents
Data scientistpage du métier →Date de l'événement / signalement
2024-10-09
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Construire et valider le modèle
Choisir une approche, l'ajuster et la régler, et vérifier qu'elle tient sur des données qu'elle n'a pas vues.
Augmentée≈ Estimation de la plateforme
Où ceci s'applique
Un banc d'essai universitaire de tâches de programmation en science des données qui exigent d'un agent qu'il travaille sur des données réelles et écrive du code, préparation et analyse comprises. Il indique qu'avec son agent de référence, les meilleurs modèles de langage actuels n'atteignent que 30,5 % de précision, ce qui laisse une large marge de progrès. Il teste des modèles de l'époque 2024 sur des tâches conçues pour l'occasion.
Ce que cela veut dire
Écrire le code de science des données est ce que les agents font de mieux, et pourtant ils échouent sur la plupart des tâches de ce banc d'essai. Le rôle du data scientist se déplace vers la direction et la vérification du code généré.
Ce que cela ne montre pas encore
Un banc d'essai de 2024 sur des tâches conçues pour l'occasion ; des modèles plus récents peuvent obtenir de meilleurs scores, et il ne mesure pas les vrais projets.
Ce que vous pouvez vérifier
Ouvrez arXiv 2410.07331 (DA-Code) et cherchez « achieves only 30.5% accuracy ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Huang et al. — DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models, arXiv 2410.07331 (submitted 9 Oct 2024; EMNLP 2024) · vérifié 2026-09-29 · Claude (VOLO agent) · interprété 2026-09-29 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.