O que esta vaga pede
Sobre a Vaga
Engenheiro de Dados Sênior na Leega Consultoria (remoto) para atuar em arquitetura lakehouse na AWS com Snowflake e tabelas Apache Iceberg no S3.
Responsabilidades
- Projetar e implementar pipelines de ingestão, transformação e disponibilização de dados em AWS, escrevendo e mantendo tabelas Apache Iceberg no S3
- Desenvolver jobs distribuídos em Spark (EMR e/ou AWS Glue), com cargas incrementais, upserts (MERGE) e reprocessamentos históricos
- Garantir integração entre Snowflake e o lakehouse Iceberg (external volumes, Glue Data Catalog, tabelas gerenciadas e sincronização de metadados)
- Executar e automatizar manutenção das tabelas Iceberg (compactação, expiração de snapshots, remoção de órfãos, evolução de schema e particionamento)
- Modelar e otimizar modelos de dados e queries no Snowflake, garantindo performance e uso eficiente de recursos
- Monitorar e otimizar custo e performance em AWS e Snowflake (dimensionamento de warehouses, clustering, políticas de cache e custo de leitura no data lake)
- Definir boas práticas de engenharia de dados (Git, CI/CD, testes de dados, documentação e linhagem)
- Implementar governança e segurança (RBAC, mascaramento e row access no Snowflake, permissionamento via Lake Formation)
- Diagnosticar e solucionar problemas de performance e disponibilidade
- Atuar como referência técnica (revisão de código, mentoria e registro de decisões de arquitetura)
- Colaborar com times de dados, produto e negócio no levantamento de requisitos e definição de soluções
Requisitos
- Experiência comprovada de no mínimo 5 anos em ambiente Cloud AWS
- Experiência comprovada de no mínimo 3 anos com Snowflake (modelagem, otimização de queries e gestão de warehouses e custo)
- Experiência em produção com Apache Iceberg (desejável 2 anos ou mais): particionamento, evolução de schema, snapshots e time travel, MERGE e rotinas de manutenção/compactação
- Experiência com Apache Spark em escala (PySpark), incluindo tuning e diagnóstico de skew e shuffle
- Conhecimento em serviços AWS para dados: S3, Glue (ETL e Data Catalog), EMR, Athena, Lambda e Step Functions
- Domínio de SQL avançado para consultas complexas e otimização em grande volume
- Experiência com modelagem e arquiteturas de Data Warehouse, Data Lake e Lakehouse
- Python aplicado à automação e engenharia de dados
Beneficios
Não há benefícios descritos na publicação.