Científico de datos — tareas, una a una
La unidad de análisis es la tarea, no el nombre del puesto. Cada una de las siguientes lleva su dirección, si el juicio se apoya en evidencia o en una inferencia de la plataforma, el razonamiento y lo que no establece.
Todas las tareas de esta página#
Plantear la pregunta y la métrica
Sigue llevándola una persona≈ Inferencia de la plataformaAveriguar qué necesita saber de verdad quien decide, y qué magnitud medible lo respondería sin premiar lo que no se busca.
La entrada es una conversación con personas que todavía no saben qué preguntar, y el riesgo es una métrica fácil de mover y equivocada de optimizar. La tarea candidata más reciente de O*NET para la ocupación es entrevistar a las partes interesadas para identificar las preguntas que el análisis de datos debería abordar: trabajo que se añade, no que se retira.
Esto se apoya en la naturaleza del trabajo y en la lista de tareas candidatas de O*NET; ningún registro de aquí mide cómo se plantea la pregunta ni quién lo hace.
Limpiar y explorar los datos
Aumentada por la máquina✓ Con evidenciaEncontrar qué falla en los datos, decidir qué corregir o excluir, y hacerse una idea de lo que pueden decir y lo que no.
Los agentes de IA pueden escribir el código de preparación, pero en un banco de pruebas de tareas realistas de análisis de datos el mejor agente resolvió solo alrededor de un tercio. Cuando el modelo es de alto riesgo, el Reglamento de IA de la UE convierte el propio trabajo con los datos en un deber documentado: los datos de entrenamiento, validación y prueba deben someterse a prácticas de gobernanza de datos que abarquen la limpieza y el examen de posibles sesgos.
Las tareas de un banco de pruebas no son los datos de una empresa, y los deberes de la UE para sistemas de alto riesgo se aplican más adelante; nada de esto mide el tiempo dedicado a la limpieza.
Construir y validar el modelo
Aumentada por la máquina≈ Inferencia de la plataformaElegir un enfoque, ajustarlo y afinarlo, y comprobar que se sostiene con datos que no ha visto.
Aquí es donde los agentes de IA son más capaces y aun así se quedan muy cortos: en bancos de pruebas públicos los mejores agentes resuelven aproximadamente un tercio de las tareas de análisis de datos y alcanzan en torno a un 30% de acierto en tareas de programación de ciencia de datos. El científico de datos dirige y revisa cada vez más código generado en lugar de escribirlo todo.
Los bancos de pruebas envejecen rápido y evalúan tareas cortas; no muestran cómo se construyen los modelos en proyectos reales ni qué parte del trabajo hacen ya los agentes.
Diseñar experimentos y leer causas
Sigue llevándola una persona≈ Inferencia de la plataformaMontar la prueba A/B o el estudio para que la respuesta sea fiable, y decir si un cambio causó el resultado o simplemente vino con él.
El razonamiento causal es donde los modelos son más débiles en la evidencia de aquí: en un banco de pruebas de preguntas estadísticas y causales tomadas de manuales y artículos, el modelo más fuerte alcanzó un 58% de acierto, y sus autores encontraron que a los modelos les cuesta usar a la vez el conocimiento causal y los datos proporcionados.
El banco de pruebas evaluó modelos de la época de 2024 con preguntas de manual; los modelos más nuevos pueden hacerlo mejor, y no mide experimentos con productos reales.
Explicar lo que significa, y lo que no
Sigue llevándola una persona≈ Inferencia de la plataformaPresentar el resultado para que quien decide entienda la incertidumbre, los supuestos y lo que cambiaría la respuesta.
Una decisión descansa en la confianza en la persona que dice qué significan los números y dónde dejan de valer. Las proyecciones laborales de EE. UU. prevén que el empleo de científicos de datos crezca un 35 por ciento entre 2025 y 2035, mucho más rápido que la media, a medida que las organizaciones incorporan sistemas de IA a su trabajo.
Una proyección no es un resultado, y cuenta empleos, no qué tareas implican esos empleos.
Cuestionar y auditar modelos
Tarea nueva✓ Con evidenciaProbar de forma independiente el modelo de otra persona — si funciona, dónde falla, si trata injustamente a algunos grupos — y documentarlo para un regulador o un auditor.
Las normas sobre modelos están escritas para personas: los supervisores bancarios de EE. UU. esperan un cuestionamiento efectivo por parte de personas con la pericia, la independencia y la posición para cambiar un modelo, y por ahora dejan la IA generativa y agéntica fuera de esa guía; la ciudad de Nueva York prohíbe usar una herramienta automatizada de contratación sin una auditoría de sesgo en el último año, hecha por un auditor independiente de la herramienta.
La guía bancaria no es exigible y abarca a los grandes bancos; la norma de Nueva York abarca herramientas de contratación en una sola ciudad. Ninguna mide cuántas personas hacen este trabajo.