O que esta vaga pede
Descrição da Vaga
Estamos buscando um(a) Engenheiro(a) de Dados Sênior para atuar na evolução da plataforma de dados que suporta iniciativas estratégicas de Inteligência Artificial e Analytics na vertical de RH.
Você fará parte de um time multidisciplinar responsável por construir e evoluir um moderno ecossistema de dados baseado em AWS, Data Lakehouse e processamento distribuído, contribuindo diretamente para produtos inovadores e soluções de IA que atendem milhares de clientes.
O profissional atuará na construção, sustentação e evolução de pipelines de dados escaláveis, garantindo qualidade, confiabilidade e performance no processamento e disponibilização de dados utilizados por produtos analíticos, agentes inteligentes e soluções de Data as a Service.
Responsabilidades
- Desenvolver e manter pipelines de dados escaláveis e resilientes utilizando Spark/PySpark.
- Atuar na evolução do Data Lakehouse e da plataforma de dados baseada em AWS.
- Implementar e otimizar processos de ingestão de dados via CDC e streaming.
- Trabalhar com Apache Kafka para processamento e movimentação de dados em tempo real.
- Estruturar, organizar e disponibilizar dados para consumo analítico e operacional.
- Desenvolver automações e orquestrações utilizando Python e Airflow.
- Administrar e otimizar consultas e acesso a dados utilizando Trino e Athena.
- Participar da definição de boas práticas de DataOps, observabilidade e qualidade de dados.
- Apoiar a evolução da infraestrutura de dados e dos ambientes cloud.
- Atuar em conjunto com cientistas de dados, analistas, arquitetos e times de produto para garantir a melhor experiência de consumo dos dados.
- Contribuir para iniciativas estratégicas relacionadas ao programa Starship e soluções de IA para os produtos de RH da companhia.
Requisitos obrigatórios
- Experiência sólida em Engenharia de Dados.
- Experiência na construção e manutenção de pipelines de dados em larga escala.
- Conhecimento avançado de SQL.
- Experiência prática com Spark ou PySpark.
- Experiência com serviços AWS para dados (S3, Glue, Athena e similares).
- Experiência com engines de consulta distribuída, como Trino e/ou Athena.
- Experiência com streaming de dados utilizando Apache Kafka.
- Experiência com CDC (Change Data Capture).
- Conhecimento em bancos relacionais e não relacionais, como PostgreSQL, MongoDB, SQL Server ou similares.
- Conhecimento em Data Lakehouse moderno e Apache Iceberg.
- Experiência com Python aplicado à engenharia de dados.
- Conhecimento em boas práticas de qualidade, governança e observabilidade de dados.
- Experiência atuando em ambientes colaborativos com times multidisciplinares.
Diferenciais
- Experiência com Apache Airflow.
- Vivência em Infraestrutura como Código (Terraform).
- Experiência em arquitetura de Data Lake/Data Lakehouse.
- Conhecimento em DataOps.
- Experiência com Metabase, Power BI ou Tableau.
- Experiência com ambientes de dados voltados para produtos SaaS.
- Vivência em projetos de Inteligência Artificial, Analytics ou produtos data-driven.
Informações Adicionais
- Local de Trabalho: 100% Remoto.