Capacidad técnicaAutomatización cognitiva2024-09-12
El mejor agente de IA resolvió solo el 34,12% de las tareas realistas de análisis de datos en DSBench, un banco de pruebas de 466 tareas de análisis y 74 de modelado tomadas de competiciones reales
Científico de datospágina de la ocupación →Fecha del hecho / publicación
2024-09-12
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Limpiar y explorar los datos
Encontrar qué falla en los datos, decidir qué corregir o excluir, y hacerse una idea de lo que pueden decir y lo que no.
Aumentada por la máquina✓ Con evidencia
Construir y validar el modelo
Elegir un enfoque, ajustarlo y afinarlo, y comprobar que se sostiene con datos que no ha visto.
Aumentada por la máquina≈ Inferencia de la plataforma
Dónde aplica esto
Un banco de pruebas de 466 tareas de análisis de datos y 74 tareas de modelado de datos tomadas de competiciones de Eloquence y Kaggle, usado para evaluar agentes de IA construidos sobre modelos como GPT-4o, Claude y Gemini. Informa de que el mejor agente resolvió solo el 34,12% de las tareas de análisis de datos y alcanzó una brecha de rendimiento relativo del 34,74% en las tareas de modelado. Evalúa modelos disponibles en 2024–2025 en tareas de competición, no trabajo con los datos de una empresa; el empleador de uno de los autores desarrolla modelos de IA.
Qué significa esto
Los agentes pueden hacer por su cuenta parte del análisis, pero en tareas realistas los mejores siguen acertando alrededor de un tercio. El trabajo recibe asistencia, y revisar lo que produjo el agente sigue siendo cosa del científico de datos.
Qué no muestra todavía
Un banco de pruebas de tareas de competición que envejece rápido; no mide proyectos reales ni qué parte del trabajo hacen ya los agentes.
Qué puedes comprobar
Abre arXiv 2409.07703 (DSBench) y busca «the best agent solving only 34.12% of data analysis tasks».
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 2 juicios enlazados de arriba se quedan donde estaban.
Fuente
Jing et al. (UT Dallas, Tencent AI Lab, USC) — DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?, arXiv 2409.07703 (submitted 12 Sep 2024; revised 11 Apr 2025) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.