O que esta vaga pede
Sobre a Vaga
Estamos em busca de um(a) Engenheiro(a) de Dados Pleno com experiência em Databricks para atuar no desenvolvimento e evolução de pipelines de dados em ambientes distribuídos, participando de todo o ciclo de processamento, desde a ingestão até a disponibilização de dados para consumo analítico e operacional.
O profissional fará parte de um time focado na construção de soluções escaláveis e de alta performance em ambiente cloud, trabalhando com grandes volumes de dados, múltiplas fontes de informação e diferentes formatos de arquivos.
Responsabilidades
- Desenvolver pipelines de ingestão, transformação e processamento de dados utilizando Databricks e Apache Spark
- Implementar rotinas de leitura, escrita e transformação de dados em diferentes origens e destinos
- Trabalhar com dados estruturados e não estruturados
- Desenvolver consultas SQL para transformação, consolidação e análise de dados
- Construir e otimizar cargas de dados em ambientes distribuídos
- Aplicar boas práticas de performance em Spark e Databricks
- Utilizar Delta Lake para armazenamento, versionamento e gerenciamento de dados
- Atuar na análise e resolução de problemas relacionados à performance, particionamento e processamento distribuído
- Integrar pipelines de dados com ferramentas de orquestração, como Azure Data Factory
- Colaborar com arquitetos, analistas e demais engenheiros na definição e implementação de soluções de dados
Requisitos
- Experiência com Databricks
- Conhecimento em Apache Spark
- Sólidos conhecimentos em SQL
- Experiência com Window Functions, como: ROW_NUMBER, RANK, DENSE_RANK, LAG, LEAD, LAST_VALUE
- Conhecimento em modelagem e manipulação de dados
- Conhecimento sobre tipos de dados e conversões
- Experiência com leitura e gravação de arquivos em diferentes formatos
- Conhecimento em processamento distribuído
- Entendimento dos conceitos de Cluster Computing
- Conhecimento sobre Narrow e Wide Transformations
- Experiência com Shuffle e seus impactos na performance
- Conhecimento em Projection (Column Pruning)
- Conhecimento em Predicate Pushdown
- Experiência com Delta Lake
- Conhecimento sobre versionamento e recuperação de dados (Time Travel)
- Experiência com os formatos Parquet e Avro
Beneficios
- Modelo de contratação: PJ