Engenheiro de dados — tarefas, uma a uma
A unidade de análise é a tarefa, não o nome do cargo. Cada uma das seguintes traz a sua direção, se o juízo assenta em prova ou numa inferência da plataforma, o raciocínio e o que não estabelece.
Todas as tarefas desta página#
Construir o pipeline
A automatizar-se✓ Com provaExtrair de uma fonte, remodelar, carregar num sítio consultável, e agendar o conjunto todo.
Os conectores para as fontes comuns são hoje comprados em vez de escritos, e o código de transformação está suficientemente bem especificado para a geração o resolver. Duas décadas de este trabalho ser repetitivo entre empresas são exatamente a condição que torna uma tarefa barata.
O pipeline correr não é o mesmo que os números estarem certos. Construí-lo nunca foi onde o tempo se ia numa equipa de dados madura; mantê-lo verdadeiro é que era.
Quando os dados estão errados e nada deu erro
Continua a ser levada por uma pessoa✓ Com provaUm campo mudou de significado a montante, um processo correu duas vezes, um fuso horário mexeu — e todos os painéis continuam verdes.
A falsidade silenciosa é a falha que define este trabalho, e não é um problema de deteção que ferramentas melhores resolvam — exige saber o que o número supostamente significa para o negócio, e isso vive nas pessoas e não no esquema. Os testes apanham aquilo em que te lembraste de testar.
Um juízo sobre a natureza da falha, não uma medição da frequência com que acontece. Os erros de dados silenciosos não estão quantificados em lado nenhum, em parte porque, por definição, são descobertos tarde ou não são descobertos de todo.
Ser dono do que um número significa
Continua a ser levada por uma pessoa✓ Com provaDefinir utilizador ativo, receita, abandono — e segurar essa definição quando duas equipas querem que signifique coisas diferentes.
As ferramentas de texto para SQL tornam consultar barato e com isso fazem as definições sustentar mais carga, e não menos: no momento em que qualquer pessoa pode perguntar, a resposta depende inteiramente de que definição o modelo apanhou. A evidência da página de analista aponta no mesmo sentido — num teste de referência construído a partir de armazéns de empresa reais um modelo simples teve zero, enquanto tinha 80 a 90% nos testes públicos, e a distância é o esquema e a semântica, e não o SQL.
Esse teste de referência é sobre consultar e não sobre quem é dono das definições, e os autores dele vendem um sistema alternativo, coisa que o registo da página de analista diz. Estabelece que os esquemas de empresa derrotam os modelos atuais; não estabelece que alguém esteja a ser contratado para manter a semântica.
O que custa continuar a perguntar
Aumentada pela máquina≈ Inferência da plataformaPartições, níveis de armazenamento, a consulta que alguém agendou de hora a hora e que percorre tudo, e a fatura ao fim do mês.
Os armazéns já trazem à superfície sozinhos a consulta cara e sugerem a correção, o que é ajuda a sério. O que resta é a decisão sobre se a resposta vale o dinheiro, e isso exige saber quem usa o número e para quê.
Nada diz sobre se os custos estão a subir ou a descer no conjunto, e consultar ser barato tende a aumentar o número de perguntas, o que pode mover a fatura em qualquer sentido.
O que tem de ser guardado, apagado, ou nunca recolhido
Continua a ser levada por uma pessoa≈ Inferência da plataformaPrazos de conservação, pedidos de apagamento, onde os dados pessoais podem estar, e conseguir prová-lo.
É uma obrigação legal implementada em pipelines, e as obrigações legais colam-se a uma pessoa e não a um sistema. As ferramentas conseguem fazer cumprir uma regra depois de alguém a ter decidido; decidi-la, e conseguir demonstrar o cumprimento depois, é a parte que fica.
Os requisitos diferem muito consoante o mercado e o tipo de dados, e o que resolveria esta tarefa seria uma ação de fiscalização que nomeasse a prática de conservação ou de apagamento de uma equipa de dados em vez da empresa como um todo — um regulador a dizer quem devia apagar o quê, e até quando.
Alimentar os sistemas que respondem em frases
Tarefa nova✓ Com provaPôr os documentos certos, com a frescura certa e com as regras de acesso certas naquilo de que a funcionalidade de IA lê.
A qualidade da pesquisa é hoje um problema de dados com um rótulo de IA, e cai aqui porque é sobre pipelines, permissões e frescura e não sobre modelos. Não existia como trabalho antes de as funcionalidades generativas chegarem aos produtos.
Aparecer trabalho novo não é efetivos novos. Na maioria das empresas isto está a ser absorvido por quem já é dono do armazém, e nada aqui diz o contrário.