Sobre a Vaga
Engenheiro de Dados Sênior / Especialista na Leega Consultoria para arquitetura lakehouse na AWS, com Snowflake consumindo tabelas Apache Iceberg armazenadas no S3.
Responsabilidades
- Projetar e implementar pipelines de ingestão, transformação e disponibilização de dados em AWS, escrevendo e mantendo tabelas Apache Iceberg no S3
- Desenvolver jobs de processamento distribuído em Spark (EMR e/ou AWS Glue), incluindo cargas incrementais, upserts (MERGE) e reprocessamentos históricos
- Garantir a integração entre Snowflake e o lakehouse Iceberg (external volumes, integração de catálogo via Glue Data Catalog, tabelas gerenciadas pelo Snowflake versus externamente gerenciadas e sincronização de metadados)
- Executar e automatizar a manutenção das tabelas Iceberg: compactação de arquivos pequenos, expiração de snapshots, remoção de arquivos órfãos, evolução de schema e de particionamento
- Modelar e otimizar modelos de dados e queries no Snowflake, garantindo performance e uso eficiente de recursos
- Monitorar e otimizar custo e performance em AWS e Snowflake (dimensionamento de warehouses, clustering, políticas de cache e custo de leitura no data lake)
- Atuar na definição de boas práticas de engenharia de dados: versionamento em Git, CI/CD, testes de dados, documentação e linhagem
- Implementar governança e segurança: RBAC, mascaramento e row access no Snowflake e permissionamento via Lake Formation
- Diagnosticar e solucionar problemas de performance e disponibilidade em ambientes críticos
- Atuar como referência técnica: revisão de código, mentoria e registro de decisões de arquitetura
- Colaborar com times de dados, produto e negócio no levantamento de requisitos e definição de soluções
Requisitos
- Experiência comprovada de no mínimo 5 anos em ambiente Cloud AWS
- Experiência comprovada de no mínimo 3 anos com Snowflake (modelagem, otimização de queries e gestão de warehouses e custo)
- Experiência em produção com Apache Iceberg (desejável 2 anos ou mais): particionamento, evolução de schema, snapshots e time travel, MERGE e rotinas de manutenção e compactação
- Experiência com Apache Spark em escala (PySpark), incluindo tuning de jobs e diagnóstico de skew e shuffle
- Conhecimento em serviços AWS voltados a dados: S3, Glue (ETL e Data Catalog), EMR, Athena, Lambda e Step Functions
- Domínio de SQL avançado para consultas complexas e otimização em grande volume de dados
- Experiência com modelagem de dados e arquiteturas de Data Warehouse, Data Lake e Lakehouse
- Python para automação e engenharia de dados
- Experiência com orquestração de pipelines (Airflow, Step Functions, dbt ou equivalente)
- Git e cultura de versionamento, testes e code review
- Inglês técnico para leitura de documentação
Beneficios
Não há benefícios explicitados na descrição original.