Capacité techniqueAutomatisation cognitive2024-09-12
Le meilleur agent d'IA n'a résolu que 34,12 % des tâches réalistes d'analyse de données sur DSBench, un banc d'essai de 466 tâches d'analyse et 74 tâches de modélisation issues de vraies compétitions
Data scientistpage du métier →Date de l'événement / signalement
2024-09-12
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Nettoyer et explorer les données
Trouver ce qui ne va pas dans les données, décider quoi corriger ou exclure, et se faire une idée de ce qu'elles peuvent dire et ne pas dire.
Augmentée✓ Appuyé sur des preuves
Construire et valider le modèle
Choisir une approche, l'ajuster et la régler, et vérifier qu'elle tient sur des données qu'elle n'a pas vues.
Augmentée≈ Estimation de la plateforme
Où ceci s'applique
Un banc d'essai de 466 tâches d'analyse de données et 74 tâches de modélisation de données tirées de compétitions Eloquence et Kaggle, utilisé pour tester des agents d'IA construits sur des modèles tels que GPT-4o, Claude et Gemini. Il indique que le meilleur agent n'a résolu que 34,12 % des tâches d'analyse de données et a atteint un écart de performance relatif de 34,74 % sur les tâches de modélisation. Il teste des modèles disponibles en 2024–2025 sur des tâches de compétition, non un travail sur les données d'une entreprise ; l'employeur de l'un des auteurs développe des modèles d'IA.
Ce que cela veut dire
Les agents peuvent faire seuls une partie de l'analyse, mais sur des tâches réalistes les meilleurs n'en réussissent encore qu'environ un tiers. Le travail est assisté, et la vérification de ce que l'agent a produit reste l'affaire du data scientist.
Ce que cela ne montre pas encore
Un banc d'essai de tâches de compétition qui vieillit vite ; il ne mesure ni les vrais projets ni la part du travail que les agents font désormais.
Ce que vous pouvez vérifier
Ouvrez arXiv 2409.07703 (DSBench) et cherchez « the best agent solving only 34.12% of data analysis tasks ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 2 jugements liés ci-dessus restes là où il était.
Source
Jing et al. (UT Dallas, Tencent AI Lab, USC) — DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?, arXiv 2409.07703 (submitted 12 Sep 2024; revised 11 Apr 2025) · vérifié 2026-09-29 · Claude (VOLO agent) · interprété 2026-09-29 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.