Capacidad técnicaAutomatización cognitiva2024-02-27
El modelo más fuerte alcanzó un 58% de acierto en preguntas estadísticas y causales tomadas de manuales y artículos, y a los modelos les costó usar a la vez el conocimiento causal y los datos
Científico de datospágina de la ocupación →Fecha del hecho / publicación
2024-02-27 · publicado 2024-06-09
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Diseñar experimentos y leer causas
Montar la prueba A/B o el estudio para que la respuesta sea fiable, y decir si un cambio causó el resultado o simplemente vino con él.
Sigue llevándola una persona≈ Inferencia de la plataforma
Dónde aplica esto
Un banco de pruebas académico de 411 preguntas con hojas de datos tomadas de manuales, materiales de aprendizaje en línea y artículos académicos, que evalúa el razonamiento estadístico y causal. Informa de que el modelo más fuerte, GPT-4, alcanza un 58% de acierto, y de que los modelos tienen dificultades con el análisis de datos y el razonamiento causal y les cuesta usar simultáneamente el conocimiento causal y los datos proporcionados. Evalúa modelos de la época de 2024 con preguntas de estilo manual, no experimentos con productos reales.
Qué significa esto
Distinguir la causa de la coincidencia es donde los modelos evaluados fueron más débiles — y es la pregunta en la que descansan la mayoría de las decisiones. Esa parte del trabajo del científico de datos es la que menos ayuda ha recibido de las herramientas hasta ahora.
Qué no muestra todavía
Un banco de pruebas de 2024 con preguntas de manual; los modelos más nuevos pueden hacerlo mejor, y no mide experimentos reales.
Qué puedes comprobar
Abre arXiv 2402.17644 (QRData) y busca «The strongest model GPT-4 achieves an accuracy of 58%».
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 1 juicio enlazado de arriba se quedan donde estaban.
Fuente
Liu et al. — Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data (QRData), arXiv 2402.17644 (submitted 27 Feb 2024; Findings of ACL 2024) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.