Ingeniero de datos — tareas, una a una
La unidad de análisis es la tarea, no el nombre del puesto. Cada una de las siguientes lleva su dirección, si el juicio se apoya en evidencia o en una inferencia de la plataforma, el razonamiento y lo que no establece.
Todas las tareas de esta página#
Construir la canalización
Automatizándose✓ Con evidenciaExtraer de una fuente, reformarlo, cargarlo en algún sitio consultable, y programar todo el conjunto.
Los conectores a las fuentes habituales ahora se compran en vez de escribirse, y el código de transformación está lo bastante bien especificado como para que la generación lo resuelva. Dos décadas de que este trabajo sea repetitivo entre empresas son justo la condición que abarata una tarea.
Que la canalización corra no es lo mismo que que los números estén bien. Construirla nunca fue donde se iba el tiempo en un equipo de datos maduro; mantenerla verdadera sí.
Cuando los datos están mal y no falló nada
Sigue llevándola una persona✓ Con evidenciaUn campo cambió de significado aguas arriba, un proceso corrió dos veces, se movió una zona horaria — y todos los cuadros de mando siguen en verde.
La falsedad silenciosa es el fallo que define este trabajo, y no es un problema de detección que resuelvan mejores herramientas — exige saber qué se supone que significa el número para el negocio, y eso vive en las personas y no en el esquema. Las pruebas cazan lo que se te ocurrió probar.
Un juicio sobre la naturaleza del fallo, no una medición de con qué frecuencia ocurre. Los errores de datos silenciosos no están cuantificados en ninguna parte, en parte porque, por definición, se descubren tarde o no se descubren.
Ser dueño de lo que significa un número
Sigue llevándola una persona✓ Con evidenciaDefinir usuario activo, ingresos, abandono — y sostener esa definición cuando dos equipos quieren que signifique cosas distintas.
Las herramientas de texto a SQL abaratan consultar y con ello hacen que las definiciones soporten más carga, no menos: en cuanto cualquiera puede preguntar, la respuesta depende por entero de qué definición recogió el modelo. La evidencia de la página de analista apunta en la misma dirección — en un banco de pruebas construido con almacenes de empresa reales un modelo a secas sacó cero, mientras sacaba entre el 80 y el 90% en los bancos públicos, y la distancia es el esquema y la semántica, no el SQL.
Ese banco de pruebas va de consultar y no de quién es dueño de las definiciones, y sus autores venden un sistema alternativo, cosa que dice la ficha de la página de analista. Establece que los esquemas de empresa derrotan a los modelos actuales; no establece que se esté contratando a nadie para mantener la semántica.
Lo que cuesta seguir preguntando
Aumentada por la máquina≈ Inferencia de la plataformaParticiones, niveles de almacenamiento, la consulta que alguien programó cada hora y que escanea todo, y la factura de fin de mes.
Los almacenes ya sacan a la luz por sí mismos la consulta cara y sugieren el arreglo, que es ayuda de verdad. Lo que queda es la decisión de si la respuesta vale el dinero, y eso exige saber quién usa el número y para qué.
No dice nada sobre si los costes suben o bajan en conjunto, y que consultar sea barato tiende a aumentar el número de preguntas, lo que puede mover la factura en cualquier dirección.
Qué hay que guardar, borrar o no recoger nunca
Sigue llevándola una persona≈ Inferencia de la plataformaPlazos de conservación, solicitudes de borrado, dónde se permite que estén los datos personales, y poder demostrarlo.
Es una obligación legal implementada en canalizaciones, y las obligaciones legales se pegan a una persona y no a un sistema. Las herramientas pueden hacer cumplir una regla una vez que alguien la ha decidido; decidirla, y poder demostrar el cumplimiento después, es la parte que se queda.
Los requisitos difieren mucho según el mercado y el tipo de dato, y lo que zanjaría esta tarea es una acción sancionadora que nombre la práctica de conservación o de borrado de un equipo de datos en vez de a la empresa entera — un regulador diciendo quién tenía que borrar qué, y para cuándo.
Alimentar a los sistemas que responden con frases
Tarea nueva✓ Con evidenciaMeter los documentos correctos, con la frescura correcta y con las reglas de acceso correctas en aquello de lo que lee la función de IA.
La calidad de la recuperación es hoy un problema de datos con una etiqueta de IA, y recae aquí porque va de canalizaciones, permisos y frescura y no de modelos. No existía como trabajo antes de que las funciones generativas llegaran a los productos.
Que aparezca trabajo nuevo no es plantilla nueva. En la mayoría de las empresas esto lo está absorbiendo quien ya es dueño del almacén, y nada de esto dice lo contrario.