O que esta vaga pede
- Experiência sólida em engenharia de dados em ambientes Cloud;
- Experiência prática com a plataforma Databricks em cenários produtivos;
- Capacidade de atuar em decisões arquiteturais e definição de padrões;
- Conhecimento em modelagem de dados e boas práticas de engenharia;
- Experiência com versionamento, automação e CI/CD;
- Perfil proativo, analítico e com boa comunicação.
Diferenciais:
- Experiência com definição de padrões e governança de dados em ambientes corporativos;
- Vivência com otimização de performance em grandes volumes de dados;
- Conhecimento em processamento de dados em tempo real (streaming);
- Experiência com infraestrutura como código ou automação de ambientes;
- Familiaridade com boas práticas de segurança e controle de acesso a dados.
Estamos em busca de um (a) Engenheiro (a) de Dados Sênior para atuar em uma arquitetura moderna de dados em Cloud, utilizando a plataforma Databricks como pilar central de processamento, governança e analytics.
O (a) profissional terá papel fundamental na definição de padrões, evolução da arquitetura e construção de pipelines escaláveis, apoiando iniciativas estratégicas de dados e analytics.
Principais Responsabilidades:
- Projetar, desenvolver e evoluir pipelines de dados escaláveis utilizando Apache Spark (PySpark e Spark SQL);
- Definir e aplicar padrões de arquitetura de dados, utilizando conceitos como Medallion Architecture (Bronze, Silver e Gold);
- Atuar na evolução da plataforma de dados, contribuindo com decisões arquiteturais e boas práticas;
- Implementar soluções com Delta Lake, garantindo confiabilidade, performance e governança dos dados;
- Atuar na governança e segurança por meio do Unity Catalog, assegurando controle de acessos e conformidade;
- Desenvolver soluções analíticas com Databricks SQL e SQL Warehouses;
- Orquestrar pipelines com Databricks Workflows, garantindo eficiência operacional;
- Estruturar processos de CI/CD e versionamento utilizando Databricks Asset Bundles, YAML e integração com Git;
- Otimizar performance e custo da plataforma, incluindo gerenciamento de clusters e workloads;
- Integrar múltiplas fontes de dados em ambientes cloud (especialmente ADLS);
- Atuar em pipelines batch e streaming conforme necessidade de negócio;
- Colaborar com times técnicos e de negócio, garantindo entendimento e entrega de valor.